AIHacker News 高分 · 3 分钟
Gemini 3.7 Flash发布,速度提升40%价格降半
谷歌发布Gemini 3.7 Flash,推理速度提升40%,价格降低50%,对独立开发者构建AI应用更友好。
- 速度提升40%,价格降低50%,适合高频调用场景
- 支持128K上下文,多模态输入,API兼容旧版
- 473分HN热帖,282条评论,开发者关注度高
查看原文 →工具BestBlogs 编程精选 · 3 分钟
Agent 迭代失控?用评测与轨迹自进化拉回准确率
阿里工程师分享一套结果驱动自进化流程,用评测与轨迹生成 patch,经四层 gate 验证,将安全审计 Agent 准确率从 77.8% 提升至 88.9%。
- 用 sec-code-bench 评测,results.jsonl 与轨迹日志驱动 patch 生成
- 四层 gate(target、guardrail、holdout、verify)过滤修改,黑名单回滚
- Kimi 77.8%→84.1%,GLM 77.8%→88.9%,DeepSeek 82.5%→87.3%
查看原文 →工具BestBlogs 编程精选 · 2 分钟
小红书开源连续自回归语音合成模型 dots.tts
小红书开源20亿参数语音合成模型dots.tts,跳过离散Token直接在连续隐空间生成,支持零样本克隆和低延迟推理,并附带编辑工具。
- 20亿参数,连续自回归,首包延迟最低54.4毫秒
- 支持零样本克隆、单步生成,及1T1A双流交互
- 开源训练、推理、微调、蒸馏代码,附dots.tts.edit编辑工具
查看原文 →创业Hacker News 高分 · 3分钟
DeepSeek Harness开发者预览版发布,GitHub获505星
DeepSeek推出Harness开发者预览版,提供新工具链,帮助独立开发者更高效构建AI应用,引发社区热议。
- DeepSeek Harness开发者预览版上线,GitHub星标505,评论229条
- 提供快速入门指南,降低AI应用开发门槛
- 适合独立开发者集成DeepSeek模型,加速产品迭代
查看原文 →AIOpenAI Blog · 3 分钟
GPT-5.6发布:初创公司构建AI代理的实用指南
OpenAI发布GPT-5.6,为初创公司提供更快的AI代理构建方案,包括智能模型选择和新的Responses API功能,帮助开发者降低成本。
- GPT-5.6支持更智能的模型选择,降低API调用成本
- 新增Responses API,简化AI代理开发流程
- 初创公司案例显示构建速度提升,成本更优
查看原文 →AIOpenAI Blog · 2 分钟
OpenAI推GPT-5.6极速版,速度提升14倍
OpenAI发布Ultrafast API服务,基于Cerebras硬件,GPT-5.6 Sol输出速度高达每秒750 tokens,适合实时应用。
- 新API服务Ultrafast,速度提升14倍
- 输出速率达750 tokens/秒,实时性强
- 基于Cerebras硬件,适合高吞吐场景
查看原文 →创业Hacker News 高分 · 3 分钟
Cerebras加速GPT-5.6推理,超快响应引热议
Cerebras与OpenAI合作,将GPT-5.6 Sol Ultra的推理速度提升至毫秒级,对依赖实时响应的AI应用开发者意义重大。
- Cerebras与OpenAI合作,GPT-5.6推理速度提升至毫秒级
- Hacker News 292分,114条评论,社区高度关注
- 对构建实时AI应用(如客服、编程助手)的独立开发者是利好
查看原文 →工具BestBlogs 编程精选 · 4分钟
快手6支团队AI落地实践:从提效到组织效率
快手6支工程团队分享AI落地真实业务的方法,解决个人提效难转组织效率的痛点,含具体数据和可复用模式。
- 综合应用中心Agent-First平台,人均月交付量翻3倍
- 电商AI小二托管商家日均GMV提升超15%
- 生活服务Harness框架,AI代码生成率从31.67%升至84.46%
查看原文 →创业BestBlogs AI 高分 · 5 分钟
AI 原生组织实战:按上下文分工,全员出原型
Ouraca 联创复盘 AI 提效陷阱:旧流程加速反而更慢,提出按上下文分工、全员出原型等做法,对独立开发者有直接借鉴。
- 用 AI 加速旧流程,开会评审时间未省,反而双重工作量
- 按上下文分工,一人负责完整闭环,减少沟通摩擦
- 取消日报周报,以 GitHub 提交记录作为进度依据
查看原文 →AIBestBlogs AI 高分 · 5分钟
DeepSeek Harness深度评测:插件架构与长程任务优势
DeepSeek Harness开源,以插件为先的Cordis架构和轨迹回放等功能,在长程任务上优于Codex,但即将涨价。
- 基于Cordis插件架构,支持四类Agent预设和轨迹回放
- 内置dsh-code-review等Skills工具,实时监控Token消耗
- 长程任务表现优于Codex,但即将涨价,需权衡成本
查看原文 →工具Hacker News 高分 · 2 分钟
Codex 登陆 Linux 桌面预览,独立开发者迎来新选择
OpenAI 的 Codex 在 ChatGPT Linux 桌面应用中开启预览,支持代码生成与执行,为 Linux 上的独立开发者提供新的 AI 编程工具。
- Codex 现可在 Linux 桌面版 ChatGPT 中预览,支持代码生成与执行
- 需 ChatGPT Plus/Pro 订阅,436 点赞 294 评论,热度高
- 独立开发者可尝试在 Linux 环境用 Codex 自动化编码任务
查看原文 →论文arXiv cs.AI · 3分钟
多智能体对话治理框架:提升金融咨询转化率32个百分点
arXiv新论文提出Experience Orchestrator框架,通过控制论治理多LLM代理对话,将高意向咨询转化率从46.1%提升至78.1%,对构建高效AI客服系统有参考价值。
- 60,000次模拟中,EO将高意向咨询转化率提升32个百分点(78.1% vs 46.1%)。
- 核心机制:Contextual Bandit选内容、PID控制器保一致性、POMDP追踪用户意图。
- 对无转化倾向用户,治理层决定系统成败;对近转化用户,朴素LLM已足够。
查看原文 →AIBestBlogs AI 高分 · 3 分钟
Claude跨设备同步,Gemini接入真实服务,Agent竞争聚焦服务与信任
Claude实现跨设备任务同步,Gemini集成OpenTable等真实服务,AI Agent从聊天转向可执行系统,竞争焦点在服务覆盖、成本与信任。
- Claude在Chrome同步会话、技能与连接器,支持Max、Team及Pro用户
- Gemini集成OpenTable、Ticketmaster、Wix,可预订、购买、安排事务
- 业界共识:模型成本下降释放需求,语音成编排入口,个人Agent靠独立记忆库增值
查看原文 →AIBestBlogs AI 高分 · 4 分钟
Milvus 3.0 自定义词典优化 BM25 与 Text Match 检索
本文讲解如何通过自定义词典提升 Milvus 中 BM25 与 Text Match 对专业词的理解,解决分词不准导致的检索问题,并介绍分布式部署方案。
- 通用分词器拆错专业词,导致 TF-IDF 失真和检索误召
- 自定义词典可补充业务概念、控制泛化、处理中英文复合词
- Milvus 3.0 的 File Resource 机制实现词典集中管理与自动分发
查看原文 →AIHugging Face Blog · 3分钟
复现2200篇ICML论文,Hugging Face总结可复现性经验
Hugging Face复现了2200篇ICML论文,发现多数论文缺少关键细节,并给出提升AI研究可复现性的实用建议。
- 复现2200篇ICML论文,仅少数完全可复现
- 常见问题:缺代码、超参数、随机种子
- 建议:开放代码、详细记录实验配置
查看原文 →论文arXiv cs.AI · 3分钟
AutoWorldModel-Bench:自动化世界模型研究新基准
新基准让AI编码代理自主改进世界模型,64次实验中91%产生非平凡研究修改,为开放式研究评估提供平台。
- 覆盖8个游戏环境,统一结构化状态表示,隔离感知与动力学建模。
- Codex-5.4和Claude Opus 4.6在63/64会话中改进起点,91%为研究型修改。
- 每次迭代仅需几分钟,适合自动化研究循环。
查看原文 →论文arXiv cs.AI · 3 分钟
SAPO:分段式提示词优化,提升模型表现
SAPO 将提示词分解为角色、上下文等段,针对性优化,在多个基准上超越现有方法,适合开发者提升 AI 应用效果。
- SAPO 将提示词拆为角色、上下文、任务、输出格式四段,分别优化
- 在 SQuADv2、GSM8K 等 5 个基准上,SAPO 平均分超 APE、OPRO 等基线
- 基于 GPT-3.5-Turbo 和 GPT-4o-mini 测试,可复现
查看原文 →工具BestBlogs 编程精选 · 5 分钟
Claude Code 团队谈上下文工程:定制化与多 Agent 实战
Anthropic 工程师 Daisy Hollman 分享上下文工程理念,强调定制化、插件抽象与多 Agent 协作,助你扩展 AI 编程到大型项目。
- 上下文窗口增长停滞,工程重心转向上下文管理
- 定制化即知识,弥合模型与团队信息差
- 多 Agent 协作与持续身份,升级为编程伙伴
查看原文 →工具BestBlogs 编程精选 · 3 分钟
AI 数字分身演讲:产品从工具进化为能力
苏杰在 QCon 用 AI 分身演讲,提出产品将拆分为 to A 执行层与 to C 决策层,人类应成为碳基全栈,利用 AI 重构工作流。
- 苏杰在 QCon 2026 用 AI 数字分身完成演讲,实验性展示 AI 协作
- 产品将拆分为 to A 执行层与 to C 决策层,软件从固态转向生成式
- 人类核心价值在提问与决策,成为跨域碳基全栈,AI 是新同事
查看原文 →论文arXiv cs.AI · 3 分钟
AI 智能体逼近 Conway 99 图问题,验证边界达 69.43%
自主 AI 研究智能体对 Conway 99 图问题给出可验证的边界,最佳验证结果为 69.43%,并提供了多种归约方法,为数学研究提供新工具。
- 穷举证明循环图最多满足 68% 约束,33/49 差分类
- 强制结构归约:存在性等价于 84 顶点 12 正则图,CP-SAT 验证
- 最佳验证工件 69.43%,14 种方法均未超越,或为稳健前沿
查看原文 →论文arXiv cs.AI · 3 分钟
笔记本上模拟大型AI代理社会的新方法
研究者提出用低参数模型替代LLM代理,在笔记本上模拟大规模AI社会,成本极低,预测误差趋势准确,对独立开发者有启发。
- 用数百次廉价查询拟合低参数模型,替代昂贵LLM代理
- 在笔记本上运行任意N个代理的社会模拟,成本仅几美元
- 基于DeepSeek等真实LLM数据验证,误差趋势预测准确
查看原文 →AIBestBlogs 编程精选 · 3 分钟
李飞飞谈空间智能:开发者应构建可行动的三维世界
李飞飞提出空间智能是AI下一阶段,世界模型需输出可探索的三维环境,开发者可参与产品化,AI应增强而非替代人类判断。
- 李飞飞:空间智能是AI下一章,当前大模型无法用少量样本理解空间关系。
- World Labs方向:世界模型需实现渲染、模拟、规划闭环,输出可编辑三维环境。
- 工程缺口:尺度一致性、物理正确性、评测存储等,普通开发者可参与产品化。
查看原文 →工具BestBlogs 编程精选 · 3 分钟
Vercel 发布 Zero 语言:专为 AI 智能体设计的编程语言
Vercel Labs 推出实验性编程语言 Zero,采用图优先存储和机器可读工具链,旨在让 AI 更高效地编写和修复代码,为 AI 辅助编程提供新方向。
- Zero 将编译器输出主要面向 AI,而非人类,.0 文本文件只是源码投影。
- 支持 JSON 格式诊断与修复计划,便于 AI 智能体自动处理。
- 引入 World 能力参数,强制执行副作用控制,提升安全性。
查看原文 →AIHugging Face Blog · 3分钟
Strands Agents与LeRobot整合,实现机器人数据闭环
Hugging Face联合亚马逊推出Strands Agents,整合LeRobot与存储桶,让开发者一站式记录、训练和部署机器人模型。
- Strands Agents支持从数据采集到模型部署的全流程管理
- 与LeRobot集成,简化机器人学习工作流
- 使用Hugging Face Storage Buckets存储数据,便于协作与版本控制
查看原文 →AIBestBlogs AI 高分 · 3分钟
端侧AI芯片新贵Acrab融资4.8亿美元,押注Agent算力
Acrab获4.8亿美元B轮融资,其端侧芯片GΞLIX 1算力达700TOPS,Prefill速度比主流快7倍,瞄准Agent时代终端算力需求。
- Acrab成立仅一年,推出首款端侧AI芯片GΞLIX 1,峰值算力700TOPS
- 实测Gemma 26B模型Prefill速度1416 Token/s,比主流端侧平台快7倍
- 融资4.8亿美元,CEO Ken Phua强调异构计算协同效率是关键
查看原文 →AIBestBlogs AI 高分 · 2 分钟
DeepSeek 应做 Agent 产品而非 SDK
观点称 DeepSeek 应聚焦 Agent Harness 产品而非 SDK,以获取用户数据,优先用户体验,类比 Claude Code 与开源 DIY 路线。
- 作者建议 DeepSeek 做 Agent Harness 产品,非 SDK
- 产品化先追用户量,再谈插件可定制化
- 类比 Claude Code 极致体验,DeepSeek 走开源 DIY
查看原文 →AIBestBlogs AI 高分 · 3 分钟
Claude 破解哈达玛矩阵,2000 阶以下空缺全清
Anthropic 研究员与 Claude 合作,突破 668 阶哈达玛矩阵,扫清 2000 阶以下 12 个空缺,展示 AI 在数学推理中的潜力。
- 突破 668 阶哈达玛矩阵,解决 12 个空缺阶数
- 问题被收录进 FrontierMath 基准测试
- 通过推特符号序列与多模型解码复现验证
查看原文 →论文arXiv cs.AI · 3 分钟
MoE量化损伤三成来自路由翻转,检测易修复难
研究发现MoE模型量化时约31%的损伤由路由翻转导致,现有方法能检测翻转但无法判断其有害性,为模型压缩提供新视角。
- OLMoE-1B-7B在4-bit KV下,路由介导损伤占比约31%
- 路由器余量检测翻转AUC达0.772,但无法区分好坏
- 研究预注册,跨三架构验证,但未提出修复方案
查看原文 →论文BestBlogs 编程精选 · 3 分钟
京东InstEmb:让嵌入理解指令,检索更准
京东零售提出InstEmb,用可学习look-ahead tokens自蒸馏未来输出语义,使嵌入一次前向即得指令遵循友好的混合表示,在多个检索基准上超过强基线。
- InstEmb被ICML 2026接收,来自京东零售
- 在FollowIR、InfoSearch等指令遵循检索任务上超过FollowIR-7B、Promptriever
- 推理时只需一次prefilling,无需生成答案,效率高
查看原文 →创业BestBlogs 商业产品 · 3分钟
AI规模化瓶颈在管理,不在技术
Uber前首席经济学家John List指出,企业AI规模化失败源于把Token用量当目标,真正需要的是嵌入工作流、由管理层引导实验与测量。
- John List:Tokenmaxxing失败因把使用量当目标,缺正确指标
- 价值在提升全要素生产率,需将AI嵌入已有工作流
- 管理层应设科学实验、快速迭代,而非盲目堆Token
查看原文 →创业Hacker News 高分 · 3 分钟
DRAM 数据残留攻击新法,独立开发者需警惕
研究者公开 DRAM 数据残留攻击新方法,可恢复内存敏感数据,对依赖云服务的独立开发者构成安全威胁。
- 新攻击方法可恢复 DRAM 残留数据,影响云服务安全
- 项目在 GitHub 开源,获 425 分 HN 热议
- 独立开发者应关注内存安全,及时更新防护措施
查看原文 →AIBestBlogs AI 高分 · 3 分钟
杭州酷飞发布全球首款站姿载人飞行器,已获近百台海外订单
杭州酷飞发布站姿Urban和坐姿Dream个人飞行器,首次实现单人eVTOL商业化,自研NA80飞控,已获近百台海外定金并建立行业首个保险方案。
- 站姿Urban和坐姿Dream两款eVTOL,首次实现单人电动垂直起降商业化
- 自研NA80飞控,双余度架构,毫秒级故障检测与热切换
- 已获近百台海外定金,与人保太保合作建立行业首个一揽子保险
查看原文 →创业Hacker News 高分 · 2 分钟
Gloomberb上线获352分,独立开发者新工具引热议
Gloomberb在Hacker News发布,获352分和176条评论,成为独立开发者关注的新工具,可能提供独特工作流。
- Gloomberb在HN获352分,176条评论,热度高
- 独立开发者可关注其工具特性,或可借鉴
- 发布当天即上榜,时效性强
查看原文 →论文arXiv cs.AI · 3 分钟
MaSRead:让复制潜在存储按内容寻址读取
MaSRead 提出按内容寻址读取复制潜在存储,使独立代理能共享计算状态,对多跳查询有效,可转移至其他模型。
- 通过无冲突复制数据类型合并键值缓存片段,实现收敛存储
- 使用硬注意力掩码隔离解码,按内容路由读取所需片段
- 在链式、管道等存储中有效,但可能错过不连续证据
查看原文 →