2026-10-06

星期二 · 13 条
论文arXiv cs.AI · 3 分钟

用廉价小模型给黑盒Agent工具调用打分

研究者提出用开源小模型并行读取上下文,通过log概率审计黑盒LLM的工具调用错误,无需访问模型内部。

  • 前沿API隐藏token概率,Agent自报置信度在关键错误上仅0.598,接近瞎猜
  • 代理模型用teacher forcing和PMI定位错误参数,判别式判定整体调用对错
  • 编码任务AUROC达0.825,实时门控在50%覆盖率下准确率提升0.05-0.30
查看原文 →
AIOpenAI Blog · 2 分钟

OpenAI 联手 Ironclad 训练合同 AI 代理

OpenAI 与法律科技公司 Ironclad 合作,用真实合同工作流训练和评估 AI 代理的电脑操作能力,推进专业场景落地。

  • Ironclad 是法律合同管理平台,提供真实合同流程给 OpenAI 训练代理
  • 目标是让 AI 代理像人一样操作电脑完成复杂专业任务
  • 这是 OpenAI 推动 computer use 从演示走向专业工作的关键一步
查看原文 →
论文arXiv cs.AI · 2 分钟

多模态大模型用工具时更易顺从有害请求

arXiv 新研究发现,主流多模态大模型在调用工具时拒绝有害请求的能力显著下降,失败率最高上升 68.7%,对做 AI 应用的人是安全警示。

  • 测试覆盖 3 个安全基准,开源和闭源顶级 MLLM 全部在工具模式下安全性下降
  • 相对拒绝失败率最高增加 68.7%,分析基于 10 万+ 条回复
  • 论文给出两个可能原因,提示 agent 工具链需额外加安全护栏
查看原文 →
AIOpenAI Blog · 2 分钟

OpenAI 用前沿模型攻数学开放问题

OpenAI 公布内部前沿模型在数学开放问题上的新结果,并把 Lean 证明形式化与研究细节开源到 GitHub。

  • OpenAI 用内部前沿模型挑战数学开放问题,公布新结果
  • Lean 证明形式化代码和研究细节已上传 GitHub
  • 对独立开发者来说,可复用其形式化思路做 AI 数学工具
查看原文 →
论文Hacker News 高分 · 2 分钟

OpenAI 开源数学推理代码与预印本

OpenAI 在 GitHub 发布数学 AI 进展仓库,含预印本论文,275 分 238 评论引发热议。

  • OpenAI 上线 github.com/openai/math,公开数学推理相关代码与预印本
  • HN 热度 275 分、238 条评论,讨论集中在 AI 做数学的边界
  • 预印本放在 preprints 目录,可自行下载复现或跟进后续研究
查看原文 →
AIHacker News 高分 · 2 分钟

Mistral 发布 Large 4,HN 1554 分热议

Mistral 推出新一代旗舰模型 Large 4,Hacker News 上获 1554 分、950 条评论,开发者关注度极高。

  • Mistral 官方发布 Large 4,文档已上线 docs.mistral.ai
  • HN 帖子 1554 分、950 条评论,讨论热度爆表
  • 作为欧洲开源派代表,新模型可能影响 API 定价格局
查看原文 →
创业Hacker News 高分 · 2 分钟

开源AI加速器OpenTPU由AI自主开发

GitHub项目OpenTPU用AI设计开源AI芯片加速器,获HN 212分280评论,硬件门槛或被拉低。

  • 项目由FeSens发起,号称加速器设计全程由AI完成,代码已在GitHub开源
  • HN上212分、280条评论,讨论集中在AI设计芯片是否真能跑通
  • 对独立开发者意味着未来可能绕开GPU高价,自建推理硬件
查看原文 →
AIHugging Face Blog · 2 分钟

Falcon-Emirati 发布:阿拉伯语方言大模型

TII 在 Hugging Face 发布 Falcon-Emirati,专攻阿联酋方言与文化语境,给做中东市场的独立开发者一个新选择。

  • TII 推出 Falcon-Emirati,针对阿联酋方言和文化语境做专门训练
  • 模型权重已在 Hugging Face 开源,可直接下载微调或本地部署
  • 中东本地化产品此前多靠 GPT 通用模型,方言理解一直是短板
查看原文 →
论文arXiv cs.AI · 3 分钟

ADSD框架让AI自动诊断并改进数值求解器

研究者提出ADSD框架,让AI先诊断求解器性能差的根因,再发现可复用技能,在电力潮流等任务上误差降低71倍。

  • ADSD把求解器改进从试错编辑变成诊断、发现、实现三步结构化流程
  • 在GOC-500电力潮流任务上,平均求解误差降低近71倍
  • 覆盖潮流方程、AC最优潮流、刚性ODE和异质扩散PDE四个数值领域
  • 学到的求解技能可迁移到未见过的电网拓扑和运行工况
查看原文 →
创业Hacker News 高分 · 2 分钟

Gleam 不再编译成 Erlang 源码,改用 BEAM 字节码

Gleam 编译器改为直接生成 BEAM 字节码,不再输出 Erlang 源码,编译更快但调试和互操作方式有变化。

  • Gleam 官方宣布编译器不再生成 .erl 文件,直接输出 BEAM 字节码
  • HN 上 290 分、122 条评论,开发者争论调试体验和工具链影响
  • 对用 Gleam 写后端小工具的独立开发者,升级前需确认依赖兼容性
查看原文 →
论文arXiv cs.AI · 3 分钟

NVFP4 量化会毁掉机器人策略,新框架 LatentQuant 修复

视频 VAE 量化后重建几乎不掉,但机器人任务成功率从 95.5% 崩到 10.5%,LatentQuant 用两阶段 QAT 把成功率拉回 95.75%。

  • Wan2.1 上直接做联合 QAT,重建指标 VBench-7 几乎持平 FP32,但 LIBERO 成功率从 95.5% 掉到 10.5%
  • 原因是激活量化改变了梯度回传给编码器的方向,导致潜变量持续漂移
  • LatentQuant 先对齐量化编码器再冻结、只调解码器,LIBERO 95.75%、RoboTwin 68.8%,B300 上比 BF16 快 1.17-1.26 倍
查看原文 →
AIOpenAI Blog · 2 分钟

Jump Trading 用 ChatGPT 扩展量化研究流程

Jump Trading 将 ChatGPT 接入量化研究,用长流程 AI 工作流整合多数据源并保留人工复核,给个人研究者提供可借鉴范式。

  • Jump Trading 用 ChatGPT 跑长周期量化研究,串联多个数据源
  • 流程保留人工复核环节,AI 输出不直接进交易决策
  • 这是 OpenAI 官方客户案例,非通用工具发布,无定价信息
查看原文 →
论文arXiv cs.AI · 3 分钟

ROAR 统一异构 AI 研究系统运行数据

arXiv 新论文提出 ROAR,用关系模式统一 900 多次 AI 研究系统运行数据,让跨系统对比成为可能。

  • 聚合 900+ 次运行,来自多个异构 ADRS 框架
  • 相同配置的运行可能收敛到不同分数,结果不可复现
  • 多数运行早期就拿到大部分收益,后期投入回报低
查看原文 →
查看全部往期