2026-08-13

星期四 · 48 条
AIHacker News 高分 · 3 分钟

Gemini 3.7 Flash发布,速度提升40%价格降半

谷歌发布Gemini 3.7 Flash,推理速度提升40%,价格降低50%,对独立开发者构建AI应用更友好。

  • 速度提升40%,价格降低50%,适合高频调用场景
  • 支持128K上下文,多模态输入,API兼容旧版
  • 473分HN热帖,282条评论,开发者关注度高
查看原文 →
AIBestBlogs AI 高分 · 5分钟

DeepSeek Harness开源:Agent框架野心之作

DeepSeek发布开源Agent框架Harness,以“一切皆插件”架构重塑Agent开发,提供四种模式,提升模型表现与可观察性,对独立开发者极具价值。

  • Harness将Agent定义为“模型+插件”,支持子代理、工具归一化。
  • 提供标准、PTC、极简、创造四种模式,适配不同场景。
  • 实测写小说、股票回测、FPS游戏,均提升模型表现。
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

Agent 迭代失控?用评测与轨迹自进化拉回准确率

阿里工程师分享一套结果驱动自进化流程,用评测与轨迹生成 patch,经四层 gate 验证,将安全审计 Agent 准确率从 77.8% 提升至 88.9%。

  • 用 sec-code-bench 评测,results.jsonl 与轨迹日志驱动 patch 生成
  • 四层 gate(target、guardrail、holdout、verify)过滤修改,黑名单回滚
  • Kimi 77.8%→84.1%,GLM 77.8%→88.9%,DeepSeek 82.5%→87.3%
查看原文 →
AIBestBlogs AI 精选 · 2 分钟

DeepSeek V4 Pro 正式上线,Agent 能力大增

DeepSeek 发布 V4 Pro 正式版,Agent 能力显著提升,原生支持 Responses API,新增三档思考强度,8 月 17 日起峰谷定价。

  • 8 月 13 日上线,APP、网页端和 API 同步可用
  • 原生支持 OpenAI Responses API,适配 Codex
  • 8 月 17 日起峰谷定价,闲时价格减半
查看原文 →
工具BestBlogs 编程精选 · 2 分钟

小红书开源连续自回归语音合成模型 dots.tts

小红书开源20亿参数语音合成模型dots.tts,跳过离散Token直接在连续隐空间生成,支持零样本克隆和低延迟推理,并附带编辑工具。

  • 20亿参数,连续自回归,首包延迟最低54.4毫秒
  • 支持零样本克隆、单步生成,及1T1A双流交互
  • 开源训练、推理、微调、蒸馏代码,附dots.tts.edit编辑工具
查看原文 →
创业Hacker News 高分 · 3分钟

DeepSeek Harness开发者预览版发布,GitHub获505星

DeepSeek推出Harness开发者预览版,提供新工具链,帮助独立开发者更高效构建AI应用,引发社区热议。

  • DeepSeek Harness开发者预览版上线,GitHub星标505,评论229条
  • 提供快速入门指南,降低AI应用开发门槛
  • 适合独立开发者集成DeepSeek模型,加速产品迭代
查看原文 →
AIOpenAI Blog · 3 分钟

GPT-5.6发布:初创公司构建AI代理的实用指南

OpenAI发布GPT-5.6,为初创公司提供更快的AI代理构建方案,包括智能模型选择和新的Responses API功能,帮助开发者降低成本。

  • GPT-5.6支持更智能的模型选择,降低API调用成本
  • 新增Responses API,简化AI代理开发流程
  • 初创公司案例显示构建速度提升,成本更优
查看原文 →
AIOpenAI Blog · 2 分钟

OpenAI推GPT-5.6极速版,速度提升14倍

OpenAI发布Ultrafast API服务,基于Cerebras硬件,GPT-5.6 Sol输出速度高达每秒750 tokens,适合实时应用。

  • 新API服务Ultrafast,速度提升14倍
  • 输出速率达750 tokens/秒,实时性强
  • 基于Cerebras硬件,适合高吞吐场景
查看原文 →
创业Hacker News 高分 · 3 分钟

Cerebras加速GPT-5.6推理,超快响应引热议

Cerebras与OpenAI合作,将GPT-5.6 Sol Ultra的推理速度提升至毫秒级,对依赖实时响应的AI应用开发者意义重大。

  • Cerebras与OpenAI合作,GPT-5.6推理速度提升至毫秒级
  • Hacker News 292分,114条评论,社区高度关注
  • 对构建实时AI应用(如客服、编程助手)的独立开发者是利好
查看原文 →
工具BestBlogs 编程精选 · 5 分钟

AI 缓存机制详解:成本可降 50 倍

本期周刊详解大模型输入 Token 缓存机制,缓存命中可大幅降低成本,并介绍各厂商缓存时限与保持方法,对控制 AI 成本有直接帮助。

  • DeepSeek V4 Flash 缓存命中价格仅为未命中的 1/50
  • Anthropic 缓存 5 分钟,DeepSeek/OpenAI 10-30 分钟,Google 1 小时内逐步失效
  • 每 4 分钟自动激活请求可保持缓存有效
查看原文 →
工具BestBlogs 编程精选 · 4分钟

快手6支团队AI落地实践:从提效到组织效率

快手6支工程团队分享AI落地真实业务的方法,解决个人提效难转组织效率的痛点,含具体数据和可复用模式。

  • 综合应用中心Agent-First平台,人均月交付量翻3倍
  • 电商AI小二托管商家日均GMV提升超15%
  • 生活服务Harness框架,AI代码生成率从31.67%升至84.46%
查看原文 →
创业BestBlogs AI 高分 · 5 分钟

AI 原生组织实战:按上下文分工,全员出原型

Ouraca 联创复盘 AI 提效陷阱:旧流程加速反而更慢,提出按上下文分工、全员出原型等做法,对独立开发者有直接借鉴。

  • 用 AI 加速旧流程,开会评审时间未省,反而双重工作量
  • 按上下文分工,一人负责完整闭环,减少沟通摩擦
  • 取消日报周报,以 GitHub 提交记录作为进度依据
查看原文 →
AIBestBlogs AI 高分 · 5分钟

DeepSeek Harness深度评测:插件架构与长程任务优势

DeepSeek Harness开源,以插件为先的Cordis架构和轨迹回放等功能,在长程任务上优于Codex,但即将涨价。

  • 基于Cordis插件架构,支持四类Agent预设和轨迹回放
  • 内置dsh-code-review等Skills工具,实时监控Token消耗
  • 长程任务表现优于Codex,但即将涨价,需权衡成本
查看原文 →
工具Hacker News 高分 · 2 分钟

Codex 登陆 Linux 桌面预览,独立开发者迎来新选择

OpenAI 的 Codex 在 ChatGPT Linux 桌面应用中开启预览,支持代码生成与执行,为 Linux 上的独立开发者提供新的 AI 编程工具。

  • Codex 现可在 Linux 桌面版 ChatGPT 中预览,支持代码生成与执行
  • 需 ChatGPT Plus/Pro 订阅,436 点赞 294 评论,热度高
  • 独立开发者可尝试在 Linux 环境用 Codex 自动化编码任务
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

Google 开发者大会:全栈 AI 工具链与智能体开发新动向

2026 Google I/O 聚焦智能体开发,发布 Managed Agents、Gemma 4 等工具,为独立开发者提供从模型到部署的全栈 AI 方案。

  • Google AI Studio 周应用创建量破 120 万,Antigravity 2.0 上线
  • Gemma 4 系列下载超 3 亿,本地化部署延迟降 44%
  • 第八代 TPU 与 Agent Studio 支持云端智能体部署
查看原文 →
论文arXiv cs.AI · 3分钟

多智能体对话治理框架:提升金融咨询转化率32个百分点

arXiv新论文提出Experience Orchestrator框架,通过控制论治理多LLM代理对话,将高意向咨询转化率从46.1%提升至78.1%,对构建高效AI客服系统有参考价值。

  • 60,000次模拟中,EO将高意向咨询转化率提升32个百分点(78.1% vs 46.1%)。
  • 核心机制:Contextual Bandit选内容、PID控制器保一致性、POMDP追踪用户意图。
  • 对无转化倾向用户,治理层决定系统成败;对近转化用户,朴素LLM已足够。
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

Claude跨设备同步,Gemini接入真实服务,Agent竞争聚焦服务与信任

Claude实现跨设备任务同步,Gemini集成OpenTable等真实服务,AI Agent从聊天转向可执行系统,竞争焦点在服务覆盖、成本与信任。

  • Claude在Chrome同步会话、技能与连接器,支持Max、Team及Pro用户
  • Gemini集成OpenTable、Ticketmaster、Wix,可预订、购买、安排事务
  • 业界共识:模型成本下降释放需求,语音成编排入口,个人Agent靠独立记忆库增值
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

WorkBuddy 升级资料库,自然语言生成 HTML 页面

WorkBuddy 推出资料库功能,用户用自然语言即可生成、编辑并同步 HTML 页面,十几秒完成网页创建,展示 AI 协同编辑新工作流。

  • 无需代码,自然语言生成 HTML,十几秒创建网页
  • 支持 CSV 与 HTML 双向同步,多人协作编辑
  • 资料库可复用 AI 成果,降低重复工作成本
查看原文 →
AIBestBlogs AI 高分 · 4 分钟

Milvus 3.0 自定义词典优化 BM25 与 Text Match 检索

本文讲解如何通过自定义词典提升 Milvus 中 BM25 与 Text Match 对专业词的理解,解决分词不准导致的检索问题,并介绍分布式部署方案。

  • 通用分词器拆错专业词,导致 TF-IDF 失真和检索误召
  • 自定义词典可补充业务概念、控制泛化、处理中英文复合词
  • Milvus 3.0 的 File Resource 机制实现词典集中管理与自动分发
查看原文 →
AIHugging Face Blog · 3分钟

复现2200篇ICML论文,Hugging Face总结可复现性经验

Hugging Face复现了2200篇ICML论文,发现多数论文缺少关键细节,并给出提升AI研究可复现性的实用建议。

  • 复现2200篇ICML论文,仅少数完全可复现
  • 常见问题:缺代码、超参数、随机种子
  • 建议:开放代码、详细记录实验配置
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

DeepSeek Harness 测评:启动门槛高,插件生态需缓行

宝玉从普通用户视角测评 DeepSeek Harness,肯定速度与插件化,但指出启动门槛高、界面细节待优化,建议先做好开箱即用体验。

  • 启动方式对非程序员不友好,需命令行操作
  • Thinking 界面闪烁,日志面板冗余影响体验
  • 建议借鉴 Codex 多 Tab 面板,优先优化基础体验
查看原文 →
论文arXiv cs.AI · 3分钟

AutoWorldModel-Bench:自动化世界模型研究新基准

新基准让AI编码代理自主改进世界模型,64次实验中91%产生非平凡研究修改,为开放式研究评估提供平台。

  • 覆盖8个游戏环境,统一结构化状态表示,隔离感知与动力学建模。
  • Codex-5.4和Claude Opus 4.6在63/64会话中改进起点,91%为研究型修改。
  • 每次迭代仅需几分钟,适合自动化研究循环。
查看原文 →
论文arXiv cs.AI · 3 分钟

SAPO:分段式提示词优化,提升模型表现

SAPO 将提示词分解为角色、上下文等段,针对性优化,在多个基准上超越现有方法,适合开发者提升 AI 应用效果。

  • SAPO 将提示词拆为角色、上下文、任务、输出格式四段,分别优化
  • 在 SQuADv2、GSM8K 等 5 个基准上,SAPO 平均分超 APE、OPRO 等基线
  • 基于 GPT-3.5-Turbo 和 GPT-4o-mini 测试,可复现
查看原文 →
工具Product Hunt · 2 分钟

Oxpecker:实时追踪供应商代码变更,避免破坏你的代码

Oxpecker 是一款新工具,能实时监控供应商代码变更,并告知你哪一行代码被破坏,帮助独立开发者快速定位问题。

  • 实时监控供应商代码变更,精准定位被破坏的代码行
  • 专为依赖第三方库的开发者设计,减少排查时间
  • 上线于 Product Hunt,适合独立开发者集成到工作流
查看原文 →
工具BestBlogs 编程精选 · 5 分钟

Claude Code 团队谈上下文工程:定制化与多 Agent 实战

Anthropic 工程师 Daisy Hollman 分享上下文工程理念,强调定制化、插件抽象与多 Agent 协作,助你扩展 AI 编程到大型项目。

  • 上下文窗口增长停滞,工程重心转向上下文管理
  • 定制化即知识,弥合模型与团队信息差
  • 多 Agent 协作与持续身份,升级为编程伙伴
查看原文 →
AIBestBlogs AI 精选 · 2 分钟

DeepSeek Harness 预览版开源,一切皆插件架构

DeepSeek Harness 发布 v0.1 开发者预览版,采用一切皆插件架构,基于 Cordis 系统,支持灵活扩展,已开源。

  • 基于 Cordis 插件系统,模型、工具、技能等全部组件化
  • 提供标准、PTC、极简、创造四种运行模式
  • 会话日志仅追加,可追溯回放,MIT 协议开源
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

AI 数字分身演讲:产品从工具进化为能力

苏杰在 QCon 用 AI 分身演讲,提出产品将拆分为 to A 执行层与 to C 决策层,人类应成为碳基全栈,利用 AI 重构工作流。

  • 苏杰在 QCon 2026 用 AI 数字分身完成演讲,实验性展示 AI 协作
  • 产品将拆分为 to A 执行层与 to C 决策层,软件从固态转向生成式
  • 人类核心价值在提问与决策,成为跨域碳基全栈,AI 是新同事
查看原文 →
工具BestBlogs 编程精选 · 5分钟

Redis集群为何只支持0号库?槽位分片与多DB冲突解析

文章解析Redis集群仅支持0号库的原因,涉及槽位分片冲突、迁移复杂度,并给出生产环境模拟多DB的三种方案。

  • 16384槽位分片与多DB逻辑隔离冲突,破坏数据归属一致性
  • 源码写死仅支持DB0,多DB会大幅提升槽位迁移复杂度
  • 可用key前缀、多实例、多集群三种方案模拟多DB
查看原文 →
论文arXiv cs.AI · 3 分钟

AI 智能体逼近 Conway 99 图问题,验证边界达 69.43%

自主 AI 研究智能体对 Conway 99 图问题给出可验证的边界,最佳验证结果为 69.43%,并提供了多种归约方法,为数学研究提供新工具。

  • 穷举证明循环图最多满足 68% 约束,33/49 差分类
  • 强制结构归约:存在性等价于 84 顶点 12 正则图,CP-SAT 验证
  • 最佳验证工件 69.43%,14 种方法均未超越,或为稳健前沿
查看原文 →
工具Product Hunt · 2 分钟

Suno 推出浏览器版生成式 DAW,音乐创作进入新阶段

Suno Studio 2.0 发布,将生成式 AI 与数字音频工作站结合,让独立创作者在浏览器中直接创作音乐。

  • Suno Studio 2.0 是浏览器内的生成式 DAW,无需安装。
  • 面向独立音乐人,提供 AI 辅助作曲与编辑。
  • 发布于 Product Hunt,引发社区讨论。
查看原文 →
论文arXiv cs.AI · 3 分钟

笔记本上模拟大型AI代理社会的新方法

研究者提出用低参数模型替代LLM代理,在笔记本上模拟大规模AI社会,成本极低,预测误差趋势准确,对独立开发者有启发。

  • 用数百次廉价查询拟合低参数模型,替代昂贵LLM代理
  • 在笔记本上运行任意N个代理的社会模拟,成本仅几美元
  • 基于DeepSeek等真实LLM数据验证,误差趋势预测准确
查看原文 →
工具Product Hunt · 1 分钟

Port22:手机端运行Claude Code与Codex

Port22 让你在手机上使用 Claude Code、Codex 等 AI 编程工具,独立开发者可随时随地管理代码项目。

  • 支持 Claude Code、Codex 等主流 AI 编程工具
  • 专为移动端优化,随时随地编码
  • 适合远程修复、快速迭代的独立开发者
查看原文 →
AIBestBlogs 编程精选 · 3 分钟

李飞飞谈空间智能:开发者应构建可行动的三维世界

李飞飞提出空间智能是AI下一阶段,世界模型需输出可探索的三维环境,开发者可参与产品化,AI应增强而非替代人类判断。

  • 李飞飞:空间智能是AI下一章,当前大模型无法用少量样本理解空间关系。
  • World Labs方向:世界模型需实现渲染、模拟、规划闭环,输出可编辑三维环境。
  • 工程缺口:尺度一致性、物理正确性、评测存储等,普通开发者可参与产品化。
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

Vercel 发布 Zero 语言:专为 AI 智能体设计的编程语言

Vercel Labs 推出实验性编程语言 Zero,采用图优先存储和机器可读工具链,旨在让 AI 更高效地编写和修复代码,为 AI 辅助编程提供新方向。

  • Zero 将编译器输出主要面向 AI,而非人类,.0 文本文件只是源码投影。
  • 支持 JSON 格式诊断与修复计划,便于 AI 智能体自动处理。
  • 引入 World 能力参数,强制执行副作用控制,提升安全性。
查看原文 →
AIBestBlogs AI 高分 · 5分钟

dLLM能否取代AR?深度解析并行生成与未来定位

本文深入探讨离散扩散语言模型(dLLM)与自回归模型(AR)的差异,分析其并行生成的理论边界与现实挑战,展望其在全局编辑、结构化生成等场景的潜力。

  • 回顾Google DiffusionGemma、LLaDA等里程碑工作,梳理dLLM发展脉络
  • 数学推导揭示并行生成存在联合一致性风险,当前dLLM呈半自回归特性
  • 核心价值或在全局编辑、结构化生成,而非低熵速度提升
查看原文 →
AIHugging Face Blog · 3分钟

Strands Agents与LeRobot整合,实现机器人数据闭环

Hugging Face联合亚马逊推出Strands Agents,整合LeRobot与存储桶,让开发者一站式记录、训练和部署机器人模型。

  • Strands Agents支持从数据采集到模型部署的全流程管理
  • 与LeRobot集成,简化机器人学习工作流
  • 使用Hugging Face Storage Buckets存储数据,便于协作与版本控制
查看原文 →
工具Product Hunt · 2 分钟

免费编程代理Freebuff上线,挑战Claude与Cursor

Freebuff推出免费编程代理,宣称可替代Claude、Cursor等付费工具,为独立开发者提供零成本编码方案。

  • Freebuff主打免费,直接对标Claude、Cursor、Replit和Devin
  • 上线于Product Hunt,引发开发者社区关注
  • 适合预算有限的solo founder尝试,降低编码成本
查看原文 →
工具Product Hunt · 1 分钟

键盘优先日历 Compass 上线,快速整理日程

Compass Calendar 是一款键盘优先的日历应用,旨在帮助用户快速整理日程,适合追求效率的独立开发者。

  • 键盘优先设计,无需鼠标即可快速操作
  • 定位“快速整理”,适合日程密集的开发者
  • 已上线 Product Hunt,可免费试用
查看原文 →
AIBestBlogs AI 高分 · 3分钟

端侧AI芯片新贵Acrab融资4.8亿美元,押注Agent算力

Acrab获4.8亿美元B轮融资,其端侧芯片GΞLIX 1算力达700TOPS,Prefill速度比主流快7倍,瞄准Agent时代终端算力需求。

  • Acrab成立仅一年,推出首款端侧AI芯片GΞLIX 1,峰值算力700TOPS
  • 实测Gemma 26B模型Prefill速度1416 Token/s,比主流端侧平台快7倍
  • 融资4.8亿美元,CEO Ken Phua强调异构计算协同效率是关键
查看原文 →
AIBestBlogs AI 高分 · 2 分钟

DeepSeek 应做 Agent 产品而非 SDK

观点称 DeepSeek 应聚焦 Agent Harness 产品而非 SDK,以获取用户数据,优先用户体验,类比 Claude Code 与开源 DIY 路线。

  • 作者建议 DeepSeek 做 Agent Harness 产品,非 SDK
  • 产品化先追用户量,再谈插件可定制化
  • 类比 Claude Code 极致体验,DeepSeek 走开源 DIY
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

Claude 破解哈达玛矩阵,2000 阶以下空缺全清

Anthropic 研究员与 Claude 合作,突破 668 阶哈达玛矩阵,扫清 2000 阶以下 12 个空缺,展示 AI 在数学推理中的潜力。

  • 突破 668 阶哈达玛矩阵,解决 12 个空缺阶数
  • 问题被收录进 FrontierMath 基准测试
  • 通过推特符号序列与多模型解码复现验证
查看原文 →
论文arXiv cs.AI · 3 分钟

MoE量化损伤三成来自路由翻转,检测易修复难

研究发现MoE模型量化时约31%的损伤由路由翻转导致,现有方法能检测翻转但无法判断其有害性,为模型压缩提供新视角。

  • OLMoE-1B-7B在4-bit KV下,路由介导损伤占比约31%
  • 路由器余量检测翻转AUC达0.772,但无法区分好坏
  • 研究预注册,跨三架构验证,但未提出修复方案
查看原文 →
论文BestBlogs 编程精选 · 3 分钟

京东InstEmb:让嵌入理解指令,检索更准

京东零售提出InstEmb,用可学习look-ahead tokens自蒸馏未来输出语义,使嵌入一次前向即得指令遵循友好的混合表示,在多个检索基准上超过强基线。

  • InstEmb被ICML 2026接收,来自京东零售
  • 在FollowIR、InfoSearch等指令遵循检索任务上超过FollowIR-7B、Promptriever
  • 推理时只需一次prefilling,无需生成答案,效率高
查看原文 →
创业BestBlogs 商业产品 · 3分钟

AI规模化瓶颈在管理,不在技术

Uber前首席经济学家John List指出,企业AI规模化失败源于把Token用量当目标,真正需要的是嵌入工作流、由管理层引导实验与测量。

  • John List:Tokenmaxxing失败因把使用量当目标,缺正确指标
  • 价值在提升全要素生产率,需将AI嵌入已有工作流
  • 管理层应设科学实验、快速迭代,而非盲目堆Token
查看原文 →
创业Hacker News 高分 · 3 分钟

DRAM 数据残留攻击新法,独立开发者需警惕

研究者公开 DRAM 数据残留攻击新方法,可恢复内存敏感数据,对依赖云服务的独立开发者构成安全威胁。

  • 新攻击方法可恢复 DRAM 残留数据,影响云服务安全
  • 项目在 GitHub 开源,获 425 分 HN 热议
  • 独立开发者应关注内存安全,及时更新防护措施
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

杭州酷飞发布全球首款站姿载人飞行器,已获近百台海外订单

杭州酷飞发布站姿Urban和坐姿Dream个人飞行器,首次实现单人eVTOL商业化,自研NA80飞控,已获近百台海外定金并建立行业首个保险方案。

  • 站姿Urban和坐姿Dream两款eVTOL,首次实现单人电动垂直起降商业化
  • 自研NA80飞控,双余度架构,毫秒级故障检测与热切换
  • 已获近百台海外定金,与人保太保合作建立行业首个一揽子保险
查看原文 →
创业Hacker News 高分 · 2 分钟

Gloomberb上线获352分,独立开发者新工具引热议

Gloomberb在Hacker News发布,获352分和176条评论,成为独立开发者关注的新工具,可能提供独特工作流。

  • Gloomberb在HN获352分,176条评论,热度高
  • 独立开发者可关注其工具特性,或可借鉴
  • 发布当天即上榜,时效性强
查看原文 →
论文arXiv cs.AI · 3 分钟

MaSRead:让复制潜在存储按内容寻址读取

MaSRead 提出按内容寻址读取复制潜在存储,使独立代理能共享计算状态,对多跳查询有效,可转移至其他模型。

  • 通过无冲突复制数据类型合并键值缓存片段,实现收敛存储
  • 使用硬注意力掩码隔离解码,按内容路由读取所需片段
  • 在链式、管道等存储中有效,但可能错过不连续证据
查看原文 →
查看全部往期