2026-10-02

星期五 · 12 条
AIOpenAI Blog · 3 分钟

OpenAI 发布 GPT-6 家族选型实战指南

OpenAI 官方博客给创业公司一份 GPT-6 选型指南,涵盖模型挑选、推理强度调优、提示词与工具编排到生产落地。

  • 官方按场景拆分 GPT-6 家族,教创业公司按成本和延迟挑模型
  • 重点讲 reasoning effort 调优,推理强度直接决定 token 花费
  • 覆盖 prompt、skills、工具编排到生产工作流的完整链路
查看原文 →
论文arXiv cs.AI · 3 分钟

K-Dense BYOK:本地运行的开源AI科研助手

一款MIT协议开源科研助手,数据与代码全存本地文件夹,用哈希链实验记录本防止模型夸大结论。

  • 自带模型密钥,支持本地或云端模型,项目就是普通文件夹,几年后仍可读
  • 实验记录本只增不删,日志由系统观察生成,agent 无权写入
  • 20 个跨学科任务上,科研质量与执行均超过两个托管平台
查看原文 →
工具Hacker News 高分 · 2 分钟

苹果推出 Pass Designer 在线工具

苹果上线网页版 Pass Designer,开发者无需 Xcode 即可在线设计 Apple Wallet 卡券,已获 HN 285 分热议。

  • 苹果官方网页工具,浏览器里直接设计 Wallet 卡券,不用装 Xcode
  • HN 上 285 分、192 条评论,讨论集中在能否替代第三方卡券生成服务
  • 对做会员卡、优惠券、活动票务的独立开发者,省掉一套自建签名流程
查看原文 →
论文arXiv cs.AI · 3 分钟

长程智能体记忆呈重尾分布,新控制器省24%token

arXiv新论文发现长程AI智能体的记忆检索呈重尾分布,提出CTWM控制器,在LongMemEval上省24.48%token且精度持平。

  • 论文指出智能体记忆集中在少数核心状态,长尾状态预测误差会累积
  • CTWM用单一指数τ分配prompt预算,保留摘要化长尾
  • LongMemEval省24.48%token,ALFWorld也一致省token,精度不降
查看原文 →
论文arXiv cs.AI · 3 分钟

论文发现:推理链传递反而增加验证风险

arXiv新论文用400条多跳问答测试发现,推理链在reasoner到verifier间传递时,忠实推理几乎不提升答案准确率,但被污染的推理会让验证判断偏移10-22%。

  • 实验用DeepSeek在MuSiQue等400条多跳问答上做reasoner-verifier消息干预
  • 无害改写只让支持判断偏移0-2.5%,污染推理却偏移10-22%
  • 人类审计中模型接受的10条污染推理有9条被盲审者拒绝或标记不清
查看原文 →
AIHugging Face Blog · 2 分钟

AI2 开源 AstaBrief 快速报告生成模型

艾伦人工智能研究所开源 AstaBrief,一个专为科研场景设计的快速报告生成模型,已上线 Hugging Face。

  • AI2 在 Hugging Face 开源 AstaBrief,主打快速生成研究报告
  • 属于 Asta 系列工具,面向科研文献检索与综述场景
  • 模型权重和用法已公开,个人开发者可直接下载试用
查看原文 →
AIHugging Face Blog · 3 分钟

AutoSynthData:为企业智能体自动生成训练数据

ServiceNow AI 在 Hugging Face 发布 AutoSynthData,用合成数据自动生成企业级 Agent 训练集,降低标注成本。

  • ServiceNow AI 开源 AutoSynthData,面向企业 Agent 自动合成训练数据
  • 核心思路是用 LLM 生成任务与轨迹,替代昂贵的人工标注流程
  • 已在 Hugging Face 发布,个人开发者可直接复用其数据生成管线
查看原文 →
AIOpenAI Blog · 2 分钟

Chatham 用 Codex 把交易验证从 30 分钟压到 4 分钟

OpenAI 官方案例:金融咨询公司 Chatham 用 Codex 和 GPT-5.6 重做工作流,单笔交易验证时间缩短 87%。

  • Chatham Financial 是家做资本市场咨询的公司,不是科技公司
  • 用 Codex 加 GPT-5.6 重写内部工具,交易验证从 30 分钟降到 4 分钟以内
  • 官方没给定价和团队规模,但这是典型的非技术公司自建 AI 工作流案例
查看原文 →
论文arXiv cs.AI · 3 分钟

小模型跑Agent微任务全军覆没

arXiv新论文测试Qwen3等小模型在Agent微任务上的表现,16种配置无一达标,量化也救不了。

  • 测试4类微任务:自动批准shell命令、写记忆、选工具、排序历史轮次
  • Qwen3 0.6B到8B共16种配置,全部未通过预设阈值
  • 4B重排器配合BM25反而比纯BM25提升0.047,但自身仍不达标
查看原文 →
论文arXiv cs.AI · 3 分钟

因果世界模型何时能帮上模块化 LLM 智能体

arXiv 新论文提出 FedCausalCompose 框架,研究因果世界模型在模块化 LLM 智能体中何时真正有用,结论是结构化工具环境收益最大。

  • 论文指出观测式世界模型存在不可消除的干预误差,无法判断支付是否授权发货
  • 提出 FedCausalCompose,用局部动作提供跨模块接口的干预响应证据
  • 实验显示结构化工具环境收益最大,对话叙事环境需短注意力锚点才有效
查看原文 →
论文arXiv cs.AI · 4 分钟

Praxa:让AI代理执行可验证的治理框架

arXiv新论文提出Praxa代理框架,把提案、授权、执行、外部验证拆成独立可测状态,但实验未证明性能优势。

  • 核心思路:提案、授权、执行、外部回读、上线是5种不同声明,不能混为一谈
  • 12个Terminal-Bench任务测试中,可靠性层与基线各通过17/36,未显示优势
  • 协调代理对比中候选方案省37% token、降34%成本,但质量未提升
查看原文 →
论文arXiv cs.AI · 3 分钟

GAP-DPO:用梯度对齐做个性化偏好优化

arXiv 新论文提出 GAP-DPO,通过梯度几何对齐选择偏好数据对,让 LLM 个性化微调效果优于标准 DPO。

  • 核心洞察:偏好数据对的选择是几何决策,决定 DPO 是纠错还是强化
  • 方法用用户效用梯度与 DPO 更新方向做对齐,配合逐轮重采样控制分布偏移
  • 在个性化文本生成基准上,风格保真度和偏好对齐均优于标准 DPO 变体
查看原文 →
查看全部往期