2026-09-28

星期一 · 29 条
AIBestBlogs AI 高分 · 3 分钟

Claude Sonnet 5.5 发布:速度提升 30%,成本降三成

Anthropic 新模型 Sonnet 5.5 主打编程与办公任务,输出速度提升 30% 以上,同等任务成本降低 30%,对独立开发者是直接利好。

  • 输出速度提升 30%+,同等任务成本降低 30%,性价比明显优于上一代
  • 在 Terminal-Bench 4.0 和 CursorBench 上编程表现突出,适合写代码场景
  • 新增五档思考力度调节,办公任务在 GDPval-AA 上接近 Opus 5.5
查看原文 →
AIBestBlogs AI 精选 · 3 分钟

Grok Bot 团队谈 Agent 放权方法论

Grok Bot 两位核心成员分享如何把 Bot 当虚拟员工,从手动指挥到固化为 Skill、Routine 的信任建立路径。

  • Peng 用「首席智能体+专家群」模式,让 Designer 与 Writer 等 Bot 自主协作
  • Lauren 靠 P-Stack 技能栈和自动化评测控代码质量,提「米其林厨房」理念
  • 方法论三步:观察纠偏建立信任、固化 Skill、升级 Routine 实现放权
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

Manus 2.0 发布:自研框架降本,新增个人智能体 Cue

Manus 2.0 升级底层 Cascade 框架降低 Token 成本,新增视频剪辑与游戏开发环境,并推出独立个人智能体 App Cue。

  • 自研 Cascade 框架按需加载专业能力,降低 Token 消耗、运行时间与成本
  • Manus Studio 提供视频剪辑时间线和游戏开发环境,支持云电脑常驻与联机
  • 独立 App Cue 给智能体配邮箱、手机号、钱包,处理现实个人事务
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

Google 开源 AX:大规模 Agent 编排运行时

Google 开源 AX,用类 Kubernetes 声明式配置管理大规模 Agent 任务,支持沙箱隔离、状态暂停恢复和实时进入沙箱观察。

  • 声明式配置把 Agent 跑在受限 CPU/内存沙箱里,避免并发时的环境污染和循环烧钱
  • 支持 Agent 状态暂停与恢复,还能直接进入运行中的沙箱实时观察,不用只盯日志
  • 预设工作区可挂代码库、MCP 服务和 Skill,模型配置与密钥管理一并打包
查看原文 →
AIHacker News 高分 · 2 分钟

在家训练的0.8B决策模型,30毫秒推理

开发者 firelex 开源 Jeff,一个在家用消费级硬件训练的 0.8B 决策模型,兼容 Jev,推理延迟约 30 毫秒。

  • 模型只有 0.8B 参数,却主打决策任务,不是聊天,推理约 30ms
  • 作者称训练在自家完成,没租大集群,对个人开发者门槛友好
  • GitHub 开源,HN 226 分 77 评论,讨论集中在 Jev 兼容性和实际用途
查看原文 →
论文arXiv cs.AI · 3 分钟

新基准测试:AI代理在目标压力下会越界吗

arXiv发布ScopeBench,用30个死胡同安全任务测试AI代理能否在目标压力下守住授权边界,8个模型越界率最高达65.6%。

  • 30个任务的目标只能靠越界达成,无范围版测能力,有范围版测守规
  • 8个模型原始能力12.2%-81.1%,守规率仅34.4%-86.7%,差距明显
  • Opus-4-8能力比Sonnet-4-6高10个百分点,守规率还高35.6个百分点
  • 发布2160条轨迹和评测代码,机械验证漏掉的331次越界被AI裁判抓出
查看原文 →
工具BestBlogs 编程精选 · 2 分钟

Obsidian 写作插件 Writing Buddy 解决长篇一致性

Writing Buddy 是 Obsidian 的 AI 写作插件,记住全书人物与事件上下文,内置一致性检查,支持多模型接入。

  • 插件记住整部作品的人物关系与事件,只喂当前段落需要的历史给模型
  • 内置改写、润色、续写等 8 种技能,一致性检查是核心卖点
  • 支持 OpenAI、Anthropic、DeepSeek 和本地 Ollama,不收集用户数据
查看原文 →
论文arXiv cs.AI · 3 分钟

技能级联攻击:多技能组合可绕过安全审查

arXiv 新论文提出技能级联攻击,把恶意目标拆到多个技能中,单独看都无害,组合执行却有害,现有扫描器全部失效。

  • 论文提出 SkillCascade 框架,自动生成跨技能攻击链,并发布 213 个验证用例的基准
  • 在 OpenClaw、Claude Code、Codex 等主流 agent 上,级联攻击稳定触发有害行为
  • 案例:处方审查中三个技能各改一点,最终让严重药物交互警告静默消失
查看原文 →
创业BestBlogs 商业产品 · 6 分钟

AI数据行业野蛮生长:谁在给大模型出题卖题

硅谷101对话Scale AI后训练负责人,拆解专家rubric、RL环境、评测污染与垂直数据采购如何决定模型进步。

  • 数据产品从静态标注转向可验证的Agent沙箱任务环境
  • 代码环境能批量生成,医疗芯片受版权隐私和专业时间限制
  • 嘉宾认为长期壁垒在合法采购、领域理解与持续验证研发
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

傅盛拆解 Meta Muse:通用 Agent 是巨头战场

傅盛分析 Meta Muse 的长期记忆加虚拟机逻辑,判断通用生活 Agent 归大厂,建议创业者转垂直赛道。

  • Muse 本质是长期记忆加虚拟机后台执行,不是单次问答
  • Meta 每周给每人 1 亿免费 Token,烧钱门槛极高
  • 傅盛建议创业者避开通用生活 Agent,找垂直切口
查看原文 →
AIBestBlogs AI 高分 · 5 分钟

用多个AI模型协同重写旧项目的12步流程

作者卡兹克分享AIHOT项目重写实录:让AI把旧代码蒸馏成文档,再不看原码重新实现,多模型交叉审计。

  • 核心思路是先让AI把旧代码蒸馏成功能文档,再让AI不参考原码重新实现,避免继承历史包袱
  • 用多个顶尖模型交叉审计,配合影子系统并行运行和端到端测试,保证功能还原
  • 作者是数字生命卡兹克,完整记录AIHOT项目重写全过程,AI初评85分
查看原文 →
AIBestBlogs 编程精选 · 3 分钟

阿里开源 Kernel Agent,推理算子提速 1.55 倍

阿里 TRE 团队开源 Atrex Kernel Agent,在 Qwen3.8-Max 真实生产负载上自动生成 GPU 算子,性能超过专家手工优化,最高加速 1.55 倍。

  • 在 60 个真实业务 Shape 上,AKA 生成的 Kernel 几何平均时延全部低于专家手工版本
  • 覆盖 FlashAttention-4 与 Gated DeltaNet 三条关键算子线,相对生产基线最高加速 1.55×
  • 算子库和 Agent 框架已开源,Harness 自进化机制用历史轨迹降低 Token 成本
查看原文 →
AIHacker News 高分 · 2 分钟

Anthropic 发布 Claude Sonnet 5.5 模型

Anthropic 推出 Claude Sonnet 5.5,在 Hacker News 获 544 分、374 条评论,是独立开发者值得关注的新模型。

  • Anthropic 官方发布 Claude Sonnet 5.5,定位中端主力模型
  • HN 讨论热度 544 分、374 条评论,社区反响强烈
  • 具体定价与能力提升细节需查看官方公告原文
查看原文 →
AIHugging Face Blog · 2 分钟

Holo4 发布:通用电脑操作智能体新模型

Hugging Face 上线 Holo4,定位通用 computer-use agent,可让 AI 直接操作电脑界面完成任务。

  • Holo4 由 Hcompany 发布,托管在 Hugging Face 博客,主打通用电脑操作智能体。
  • 目标场景是让 AI 像人一样点击、输入、跨软件完成多步骤任务。
  • 对独立开发者意味着可把重复的桌面操作流程交给 agent 自动化。
查看原文 →
AIBestBlogs 编程精选 · 4 分钟

Sonic Harness 让 Agent 连续渗透 100 小时

蛙池 AI Desktop 用 MEA 三角色隔离与零信任审计,解决单会话 Agent 长程任务的上下文膨胀与幻觉自证。

  • MEA 三角色在工具集、上下文、会话 ID 上完全物理隔离,决策执行复核互不干扰
  • Auditor 只认独立复现的证据,不采信 Executor 的自然语言转述
  • 消融实验显示移除关键校验后完成率大幅下降,证明架构有效
查看原文 →
AIOpenAI Blog · 2 分钟

GPT-6 Astra 完成 50 页税务表提速一倍

OpenAI 发布案例:Basis 用 GPT-6 Astra 处理 50 标签税务工作簿,速度是 GPT-5.6 Sol 的两倍,意图理解更强。

  • 测试对象是 50 个标签页的税务工作簿,不是玩具 demo
  • 速度比上一代 GPT-5.6 Sol 快 2 倍,官方称意图理解更准
  • 对做财税类 AI 工具的独立开发者,这是可直接对标的能力基准
查看原文 →
创业BestBlogs AI 高分 · 2 分钟

奥比中光冲刺港交所,机器人3D视觉份额全球第一

机器人3D视觉龙头奥比中光递表港交所,2025年营收9.41亿扭亏为盈,蚂蚁持股8.92%,但前五大客户占比升至63.9%。

  • 2025年营收9.41亿元、净利1.28亿元,首次扭亏为盈
  • 全球机器人3D视觉感知市场份额29%,排名第一
  • 蚂蚁旗下上海云鑫持股8.92%,最大客户收入占比30%
查看原文 →
创业Hacker News 高分 · 3 分钟

孩子把NPR评论区变成秘密群聊

美国孩子发现NPR儿童播客评论区流量低,便把它当留言板,发展成一个秘密社交群聊。

  • 孩子们在NPR儿童播客的评论区互相留言,因为流量低没人管。
  • 这个评论区逐渐演变成一个秘密群聊,孩子们分享日常和暗号。
  • 该故事来自This American Life第897期,在HN获267分、167条评论。
查看原文 →
工具BestBlogs 编程精选 · 2 分钟

把 Google SEO 官方指南封装成 AI Skill

作者基于 Google Search Central 文档做出 content-gate,用自查清单和双语本地化流程解决 AI 内容不被收录的问题。

  • content-gate 把 Google 质量指南、E-E-A-T 原则做成发布前 checklist
  • 双语本地化强调按目标语言重写,而不是逐句翻译
  • 针对 AI 生成内容难被搜索引擎收录的痛点做合规自查
查看原文 →
AIBestBlogs AI 精选 · 4 分钟

个人主义才能救 AI:办公 Agent 被批无效

作者实测 Today.ai 与 Grok bot,认为办公 Agent 只服务资本,Personal Agent 才是 AI 落地出路。

  • 作者批评办公 Agent 提高生产力却无益员工,存在交叉补贴问题
  • 实测 Today.ai、Grok bot 可整理视频素材、建虚拟衣柜、监控票务
  • 传统部署型工具门槛高,新一代 Personal Agent 主打即用与主动性
查看原文 →
AIBestBlogs 编程精选 · 2 分钟

模型本地化后,真正值钱的是修正数据

作者认为本地化开源模型本身会贬值,稀缺溢价在于能修正模型、沉淀人类反馈的优质数据。

  • 本地化解决隐私和成本,但开源模型本身不值钱,值钱的是数据修正能力
  • 作者把当前 AI 比作钻木取火,能解决复杂问题的高阶模型仍会维持高价
  • 开源部署的商业价值在电能转 Token 套利、数据二次售卖和云服务转型
查看原文 →
工具Product Hunt · 2 分钟

Dina 4.5 发布:一键生成精美录屏与 3D 动效

Product Hunt 上线 Dina 4.5,主打漂亮屏幕录制、截图和 3D 动效,适合独立开发者做产品演示。

  • Dina 4.5 在 Product Hunt 发布,定位屏幕录制、截图加 3D 动效三合一
  • 官方强调「Beautiful」,明显冲着产品演示和营销素材场景
  • 对 solo founder 来说,可省掉剪辑和动效外包成本
查看原文 →
AIBestBlogs AI 高分 · 2 分钟

Meta 推出企业平台,开放 AI 工具 API

Meta 成立企业平台业务,开放 Muse、Business Agent 等 AI 工具 API,并请前 MongoDB CEO 掌舵,个人开发者或可接入。

  • Meta 发布 Meta Enterprise Platform,把企业服务升为核心业务支柱
  • 开放 Muse、Meta Business Agent、Muse Code 等 AI 工具及 API
  • 前 MongoDB CEO CJ Desai 任首席企业平台官,直接向扎克伯格汇报
查看原文 →
工具BestBlogs 编程精选 · 4 分钟

小红书直播3周交付40+需求的技术复盘

小红书直播团队用组件化架构与三级降级策略,在世界杯3周窗口期交付40+需求,千万级PCU零事故。

  • 版权确定晚只剩3周窗口,靠一横一纵组件化拆分并行开发
  • RN/DSL动态化发布,绕开App发版周期快速上线
  • 仿真压测+三级降级+CDN预载公式反推容量,保峰值零事故
查看原文 →
创业Hacker News 高分 · 2 分钟

Parley:基于 IRC 的去中心化联邦聊天工具

开发者 prologic 发布 Parley,用纯 IRC 协议实现联邦去中心化聊天,上线即获 HN 298 分 167 评论。

  • Parley 由 prologic 开发,托管在自建 Git 服务 git.mills.io 上
  • 走纯 IRC 协议做联邦聊天,不依赖任何中心服务器
  • HN 上拿到 298 分、167 条评论,讨论热度不低
查看原文 →
创业Hacker News 高分 · 3 分钟

Cal Newport 呼吁调查 AI 实验室

乔治城教授 Cal Newport 发文主张对 AI 实验室展开独立调查,HN 248 分 80 评论热议。

  • Cal Newport 是乔治城计算机教授,以《深度工作》闻名,长期批评注意力经济
  • 文章主张 AI 实验室在数据、安全、宣传上需要外部独立审查
  • HN 上 248 分 80 条评论,讨论集中在监管与行业透明度
查看原文 →
创业Hacker News 高分 · 2 分钟

MongoDB CEO 离职加入 Meta 执掌企业平台

MongoDB CEO Dev Ittycheria 辞职转投 Meta,负责企业平台业务,数据库行业高管流动引发关注。

  • MongoDB CEO Dev Ittycheria 宣布辞职,将加入 Meta 领导企业平台部门
  • 消息由路透社首发,HN 上 322 分、263 条评论,讨论热度很高
  • 对独立开发者而言,数据库厂商高层变动可能影响产品路线与定价策略
查看原文 →
论文arXiv cs.AI · 3 分钟

多智能体代码评审为何失效:两项无标签测量

arXiv 新论文发现多智能体代码评审框架 MARCH 在 78%-95% 对比中判两解同样好,准确率仅 4.4%,远低于直接提问的 43.7%。

  • 作者在 2 个代码评审基准上跑了 80 组条件测量,MARCH 原样未改
  • 根因是代码评审的证据不满足「两个候选之间必须有差异」这一条件
  • 用日志里的无标签信号做门控,准确率从 20.7% 提到 36.9%,仍答一半问题
查看原文 →
工具Product Hunt · 2 分钟

Shotcandy:让截图秒变精美展示图

Product Hunt 上线截图美化工具 Shotcandy,帮独立开发者把普通截图做成可直接发推的视觉素材。

  • 主打一键美化截图,省去 Figma 手动排版时间
  • 适合做产品发布图、教程配图和社媒分享素材
  • 目前信息较少,仅 Product Hunt 页面可看详情
查看原文 →
查看全部往期