AIBestBlogs AI 高分 · 2 分钟
OpenAI 发布常驻智能体 dots,24 小时主动干活
OpenAI 推出由 GPT-6 Astra 驱动的常驻智能体 dots,拥有独立云电脑,可连接 4000+ 应用,面向 Pro 与 Business Premium 用户开放。
- dots 有独立云电脑和浏览器,能 24/7 主动推进任务,不再只是问答机器人
- 支持连接 4000 多个应用,跨 ChatGPT、Slack、Teams 同步上下文
- 分个人 dot 和企业专员 dot 两种模式,先向 Pro 和 Business Premium 开放
查看原文 →AIBestBlogs AI 精选 · 3 分钟
Claude Sonnet 5.5 发布:速度提升 30%,单价不变
Anthropic 发布 Sonnet 5.5,API 价格不变但生成速度提升 30%,低 effort 档位即可超越上代最高档,单任务成本最多降低 30%。
- API 单价维持每百万输入 2 美元、输出 10 美元,速度提升 30% 以上
- CursorBench 4.0 上 Low effort 得分 35.8%,成本仅 0.50 美元,反超 Sonnet 5 Max 的 34.1%
- 官方建议重新评估 effort 档位,Xhigh 到 Max 成本从 3.88 涨到 9.67 美元但得分仅升 2.4%
查看原文 →AIOpenAI Blog · 2 分钟
OpenAI 发布 GPT-6.1 Sol,价格降至 Astra 五分之一
OpenAI 推出 GPT-6.1 Sol,主打编程与电脑操作,API 输入输出价格仅为 Astra 的五分之一,个人开发者也能负担。
- GPT-6.1 Sol 面向编程、电脑操作和专业工作场景,定位接近 Astra 级智能
- API 输入输出 token 价格降到 Astra 标准价的五分之一,成本大幅下降
- 对独立开发者来说,复杂 agent 工作流的调用成本可能首次进入可承受区间
查看原文 →AIBestBlogs AI 精选 · 3 分钟
Manus 2.0 发布全天候智能体 Cue
Manus 更新 2.0,推出 Cascade 架构与云端电脑,成本降 32%,并发布个人智能体 Cue,可独立执行任务。
- Cascade 架构让 Token 消耗降 23.2%,任务耗时缩短 28.2%
- Cloud Computer 提供独立云端环境,支持视频编辑和游戏开发
- 新应用 Cue 主打个人 Agent,可连接日常服务全天候跑任务
查看原文 →工具BestBlogs 编程精选 · 2 分钟
Android Bench 2.0 发布,用长周期任务评估 AI 编程能力
Android 官方推出 Android Bench 2.0,引入长周期任务和持续评分法,衡量 AI 处理复杂工程需求的实际水平。
- 评估重点从简单增量修复转向长周期任务,覆盖依赖升级、新功能构建和跨平台移植
- 用持续评分法替代二元制评分,并整合智能体评估和多模态评估
- 测试显示 AI 写新代码强于重构,GPT-6 Astra 在长周期任务通过率上领先
查看原文 →工具BestBlogs 编程精选 · 3 分钟
阿里云 Agent Sandbox 每分钟可创建 10 万沙箱
阿里云发布面向 Agent 的沙箱基础设施,解决代码不可信、任务时长不可预测和资源成本问题,冷启动 P99 低于 180 毫秒。
- 阿里云 Agent Sandbox 每分钟可创建 10 万个沙箱,冷启动 P99 小于 180 毫秒
- 深休眠唤醒 P99 低于 600 毫秒,支持多集群容灾和休眠恢复
- AMD、金山办公、前程无忧已参与实践,称能降低资源成本并提升稳定性
查看原文 →创业Hacker News 高分 · 3 分钟
德里电力损耗从50%降到5%的治理路径
IEEE Spectrum 报道德里通过智能电表、分区承包与反窃电执法,把电网损耗从50%压到5%,对做本地化服务的独立开发者有借鉴意义。
- 德里电网损耗从50%降至5%,靠的是智能电表+分区承包+反窃电执法三件套
- HN 上421分、247条评论,讨论集中在私有化承包是否可复制到其他城市
- 核心经验:把大问题拆成可问责的小片区,和一人公司做垂直细分一个逻辑
查看原文 →创业Hacker News 高分 · 3 分钟
研究揭示对话式 AI 智能体隐私追踪风险
一篇论文分析网页与移动端对话 AI 智能体的隐私问题,发现其可能像追踪器一样泄露用户数据,对开发者选型有参考价值。
- 论文标题为《像蝴蝶一样提示,像追踪器一样蜇人》,分析对话 AI 的隐私追踪行为。
- 在 Hacker News 获 406 分和 128 条评论,引发对 AI 隐私的广泛讨论。
- 研究覆盖网页和移动端智能体,提示独立开发者需关注用户数据合规。
查看原文 →AIBestBlogs AI 精选 · 3 分钟
AI影像圆桌:技术免费后审美成唯一硬通货
四位AI影像一线操盘手指出,角色一致性等技术难题正被大模型快速抹平,批量产出的只是素材,人的审美与故事判断力才是稀缺资源。
- 梦觉工作室朱雷蒙等4位从业者参与圆桌,讨论AI视频落地真实痛点
- 角色一致性等工程难题正被模型迭代解决,技术护城河保质期极短
- 算力虽贵但真正稀缺的是高审美导演,AI长篇叙事仍带浓厚AI味
查看原文 →AIBestBlogs AI 高分 · 3 分钟
Meta 推出免费个人 Agent Muse,瞄准超级入口
Meta 的 Muse 以免费个人助理整合北美碎片化服务,帮用户处理退订、退款等杂事,试图复制微信式超级入口。
- Muse 免费帮用户处理取消订阅、退款、购物等杂事,靠口碑在美国快速传播
- Meta 不强调模型参数,而是突出 agent 任务完成能力,称模型专为 agent 训练
- 真正看点是能否从 Amazon、Apple 手中抢下广告、电商与新入口利润
查看原文 →工具BestBlogs 编程精选 · 4 分钟
阿里团队复盘 AI Native 前端研发实践
阿里稳定性团队用结构化规则包 Skill 和集成工作台 Anchor,解决 AI 生成代码质量失控与协作成本问题。
- Skill 用 When/What/Don't/How/Map 五维结构,把专家经验变成 AI 可执行约束
- 原型库与正式库分库,解决设计与前端节奏冲突,还原成本大幅降低
- 提出 PDFE 复合角色,探讨 AI 全栈开发的适用边界与 ROI
查看原文 →论文arXiv cs.AI · 3 分钟
开源模型溯源新方法:用第三方见证判断父子关系
研究者提出 Witness Overlap 方法,无需训练即可判断两个开源模型检查点谁先谁后,在 176 个模型上准确率达 95.3%。
- 传统溯源只能判断两个模型是否相关,无法判断谁是谁的父模型
- 新方法引入第三个同家族模型作为见证,比较局部几何结构来定向
- 在 16 个家族 176 个 LLM 检查点上,父子判断准确率 95.3%
- 对权重噪声和稀疏剪枝鲁棒,还提出 SVD 降维变体比 Frobenius 余弦更稳
查看原文 →论文arXiv cs.AI · 3 分钟
VLA模型遇矛盾前提会硬撑执行错误任务
arXiv新论文提出ConflictVLA-Bench,测试8个视觉语言动作模型发现,任务前提无效时模型仍会继续冲向原目标,而非停下。
- 基准含2826个矛盾任务,基于LIBERO,分4类冲突、4种结构配置
- 无效前提下原目标完成率至少降17.3个百分点,OpenVLA降幅达56.2
- 模型失败后仍保留早期轨迹结构、继续逼近原目标,论文称之为Failed Persistence
查看原文 →工具BestBlogs 编程精选 · 3 分钟
英伟达开源 Agent 安全平台,三层管控防失控
英伟达发布开源 Nvidia Open Agent Safety Platform,用沙箱、DPU 硬件监控和资源管控三层体系,把 Agent 安全约束放到模型外部。
- OpenShell 提供隔离运行时沙箱,做基础设施级行为追踪与策略执行
- Nvidia Sentry 基于 DOCA,在 BlueField-4 DPU 芯片层实时中止违规操作
- SpaceXAI、Salesforce、SAP 及多家机器人公司已接入该平台
查看原文 →AIOpenAI Blog · 1 分钟
OpenAI 推出主动式助手 dots
OpenAI 发布 dots,一个能跨复杂项目与日常任务持续推进的主动式助手,强调用户始终掌控进度。
- dots 定位为主动式助手,可跨多个复杂项目持续工作
- 官方强调用户保持控制权,工作推进过程可随时介入
- 目前仅有一句话介绍,具体功能、定价和开放时间未公布
查看原文 →AIHugging Face Blog · 2 分钟
MCP 智能体新增来源感知验证能力
Hugging Face 博客介绍为 MCP 智能体加入来源感知验证,让 AI 不只核对事实,还核对信息来源是否可靠。
- 传统验证只查事实真假,新方法同时追踪信息来自哪个源
- 面向 MCP 智能体,可接入现有工具链做来源可信度判断
- 由 MultiverseComputingCAI 发布在 Hugging Face 博客,暂无热度数据
查看原文 →论文arXiv cs.AI · 3 分钟
LLM智能体自动跑晶体塑性仿真工作流
研究者发布CP-Agent,用ReAct范式自动完成晶体塑性建模全流程,四个案例均复现实验数据。
- 基于ReAct范式,LLM自主选工具、排顺序,数值搜索交给现成优化器
- 四个案例:316L不锈钢四滑移参数标定、铜基准验证、铜初始织构反演、镁合金五道次轧制
- 靠工具schema而非硬编码注入领域知识,推理轨迹可见可审计
查看原文 →论文arXiv cs.AI · 3 分钟
LLM评审验证:重叠稀疏导致误判率飙升
arXiv论文证明,当人工标注重叠率仅5%时,选错最佳LLM评审的概率高达65%,并给出最小重叠率与分层分配方案。
- 5%重叠率下,错误部署决策率达25%,十选一挑错评审概率65%
- 推导出最小重叠公式:非边界评审只需ρ≥0.25即可稳定
- 零成本分层抽样方案,信息分层有效时误拒率减半
查看原文 →论文arXiv cs.AI · 3 分钟
SMARtCARE:隐私保护的临床决策支持智能体系统
SMARtCARE提出四状态临床决策支持架构,通过有损指纹和医生介入实现隐私保护与可追溯性。
- 四状态架构:Stable、Meta-cognitive、Assisted、Regulated,仅在医生操作时检索完整记录。
- 使用六通道有损指纹匹配历史病情,在MIMIC-III中14名患者里识别出1例复发。
- 所有决策日志可追溯且归属正确,但固定模式库在MIMIC-IV中未匹配到任何病例。
查看原文 →工具Hacker News 高分 · 2 分钟
Tcl/Tk 9.1 发布,HN 229 分热议老牌脚本语言
Tcl/Tk 发布 9.1 版本,在 Hacker News 获 229 分、78 条评论,老牌脚本语言与 GUI 工具包仍在更新。
- Tcl/Tk 9.1 正式发布,官方页面公布更新细节,HN 获 229 分
- 评论区 78 条讨论,老开发者回忆 Tk 写桌面 GUI 的黄金年代
- 对独立开发者,Tk 仍是零依赖跨平台小工具界面的轻量选择
查看原文 →工具BestBlogs 编程精选 · 3 分钟
阿里 QCon 上海站分享 AI Agent 落地实战
阿里 10 余位 AI 实战派将在 QCon 上海站分享 Agent 落地、AIGC 工业化与 AI 代码质量保障经验。
- 云栖大会后阿里把 QCon 上海站主题定为「智以致用」,聚焦 AI 从概念到业务落地
- 分享覆盖 AI 基础设施、Agentic AI 架构、AIGC 内容流水线、AI Native 质量保障 4 个方向
- 核心矛盾:代码生成速度提升 10 倍后,如何用自动化验证兜住系统质量
查看原文 →创业BestBlogs 商业产品 · 6 分钟
特斯拉FSD十三年:从Mobileye决裂到自研芯片
特斯拉FSD十三年演进史曝光,从依赖Mobileye到自研AI3芯片,揭示纯视觉方案背后的团队博弈与成本取舍。
- 特斯拉早期用Mobileye黑盒方案,2016年决裂后转投英伟达过渡
- Jim Keller主导自研AI3芯片,感知模块经历HydraNet、BEV、占用网络四次升级
- 内部硬件与软件团队为成本、算力、移除雷达激烈拉扯,催生HW4.0
查看原文 →论文arXiv cs.AI · 3 分钟
新论文:用真实帧检索替代潜空间子目标规划
arXiv 新论文 Metro-WM 指出潜空间子目标常物理不可实现,改用离线经验帧建图检索,长程成功率提升 37 个百分点。
- 作者证明主流宏观规划器生成的潜子目标经常物理上无法实现,是长程规划失败主因
- Metro-WM 把离线专家轨迹的帧建成图,跨片段拼接成通往目标的路径,而非凭空生成向量
- 长程成功率比次优方法高 37.33 个百分点,速度快 10.9 倍,离线算力省 13-56 倍
查看原文 →AIBestBlogs AI 高分 · 2 分钟
OpenAI 发布 GPT-6 Luna 决策 API,150 毫秒出结果
OpenAI 推出 Decisions API,基于 GPT-6 Luna 做快速分类决策,延迟 150 毫秒,价格远低于聊天模型,适合 Agent 和审核场景。
- 模型定位 System 1 快思考,不做推理和解释,直接返回选项加概率值
- 延迟压到 150 毫秒,支持文本和图像输入,目前是有限预览阶段
- 官方称价格远低于标准聊天模型,适合客服工单分类和内容审核
查看原文 →AIBestBlogs AI 高分 · 3 分钟
OpenAI 2026 开发者大会:个人 Agent 时代到来
OpenAI 发布个人 Agent Dots、GPT-6.1 Sol 模型、ChatGPT Space 和 Codex Cloud,AI 从人类优先转向 Agent 原生。
- Dots 个人 Agent 支持 24 小时在线,自带云电脑和浏览器环境
- GPT-6.1 Sol 发布 7 天即迭代,降低缓存价格提升 Agent 性价比
- 推出 OpenAI Marketplace,打通第三方产品订阅生态
查看原文 →AIBestBlogs AI 高分 · 3 分钟
OpenAI DevDay 发布智能体 Dots 与协作空间
OpenAI 在 DevDay 推出可操控电脑和浏览器的智能体 Dots、ChatGPT Space 协作空间,以及更便宜的 GPT-4o 系列模型。
- Dots 智能体能自主操作电脑、浏览器,还能在 Slack 里当代理人跑任务
- ChatGPT Space 把人和 AI 放进同一工作区,按页面协作、共享文件
- GPT-4o-mini 替代 GPT-3.5,速度更快价格更低,Agents API 开放预览
查看原文 →AIBestBlogs AI 精选 · 2 分钟
DeepSeek Harness 桌面端发布,开箱即用
DeepSeek Harness v0.2 预览版推出 macOS 和 Windows 安装包,从命令行转向桌面端,降低上手门槛。
- v0.2 预览版提供 macOS 和 Windows 桌面安装包,无需命令行即可使用
- 新增可视化插件管理,支持 npm 包名直接安装卸载,还有对话式创造模式
- 内置自动化定时任务插件,优化代码变更差异对比,未来计划建插件市场
查看原文 →AIHacker News 高分 · 2 分钟
OpenAI 发布 GPT 6.1 Sol,价格降至五分之一
OpenAI 推出新模型 GPT 6.1 Sol,号称接近 Astra 级智能但价格只有其五分之一,对独立开发者成本影响直接。
- OpenAI 官方发布 GPT 6.1 Sol,主打近 Astra 级能力、价格仅五分之一
- HN 上 747 分、685 条评论,讨论热度极高
- 对按 token 付费的独立开发者,API 成本可能大幅下降
查看原文 →AIBestBlogs AI 高分 · 3 分钟
OpenAI 2026 大会:常驻智能体 Dots 与 GPT-6.1 Sol
OpenAI 发布可操作电脑的常驻智能体 Dots、协作空间 Space,以及更便宜的 GPT-6.1 Sol 模型。
- Dots 是常驻在线智能体,能操作电脑和浏览器,不用每次手动唤起
- ChatGPT Space 支持跨页面共享上下文,人和 AI 在同一工作区协作
- GPT-6.1 Sol 和 UltraFast 主打更便宜更快,官方称已实现 AI 实习生目标
查看原文 →AIBestBlogs AI 高分 · 2 分钟
Meta 用 RL-XAR 消除 AI 写作的废话味
Meta 提出 RL-XAR,用人类高手范例训练挑剔评分器,让 AI 写作摆脱空洞流畅,学术与文学任务胜率大幅提升。
- 核心思路是先训练一个能分辨人类高手与 AI 套话的评分规则,再用它做强化学习
- 学术论文写作胜率 89%,文学续写胜率 95%,对比基线提升明显
- 对独立开发者意味着:提示词里写清评分标准,比反复说「写得好一点」更有效
查看原文 →AIOpenAI Blog · 3 分钟
OpenAI DevDay 2026 发布 GPT-6 Astra 等 20 项更新
OpenAI 在 DevDay 2026 一口气发布 20 多项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API 与安全工具,开发者可直接接入。
- 主发布是 GPT-6 Astra,同时更新 ChatGPT 与 Codex 两条产品线
- 官方称共 20 多项公告,含 API、安全能力和面向开发者新工具
- 具体定价、上下文长度和可用地区需看原文,摘要未给出细节
查看原文 →AIHugging Face Blog · 2 分钟
英伟达发布 Kumo Tabular 表格预测模型
英伟达在 Hugging Face 发布 Kumo Tabular,主打表格数据预测的精度与效率平衡,个人开发者可直接调用。
- 英伟达在 Hugging Face 上线 Kumo Tabular,专攻表格数据预测任务
- 官方称在精度与推理效率之间取得新平衡,优于传统梯度提升方案
- 模型托管在 Hugging Face,个人开发者可直接下载或调用 API 试用
查看原文 →AIBestBlogs AI 高分 · 3 分钟
Prompt 工程式微,Harness 时代来临
作者认为精细化 Prompt 技巧已近乎失效,AI 能力正被 Harness 吸收并内化进模型,核心竞争力转向语义表达与上下文提供。
- 传统遣词造句式 Prompt 优化对现代模型影响极小,效果多是心理错觉
- 原有 Prompt 价值已沉淀到 Agent Skill 和 Context 工具中
- 高效交互靠清晰语义、充分上下文和费曼式需求描述
查看原文 →AIBestBlogs 编程精选 · 3 分钟
Chrome 前负责人警告:AI 写代码最大的风险是认知投降
Addy Osmani 指出,开发者若习惯直接接受 AI 生成结果,会失去对系统的理解与掌控,未来竞争力在于目标定义与结果负责。
- Addy Osmani 提出「认知债务」概念,代码写完但没人看懂系统是最大隐患
- 建议用决策记录、质量护栏、OWNERS 责任制来抵消多 Agent 工作流风险
- 软件工程分水岭从实现速度转向目标定义,工程师要做掌控者而非执行者
查看原文 →AIHacker News 高分 · 2 分钟
OpenAI 发布 Dots 常驻智能体产品
OpenAI 推出名为 Dots 的常驻智能体,官方页面发布后登上 HN 首页,444 分 337 条评论,个人开发者可关注其自动化能力。
- OpenAI 官方发布 Dots,定位 always-on agents,即持续在线的常驻智能体
- HN 讨论热度 444 分、337 条评论,属于当日头部话题
- 官方页面信息有限,具体定价与开放范围尚未在摘要中披露
查看原文 →