2026-10-01

星期四 · 18 条
AIBestBlogs 编程精选 · 3 分钟

谷歌发布 Gemini 4 Argon,输出上限提至 100 万 token

Google DeepMind 推出前沿模型 Gemini 4 Argon,输出 token 上限从 6.4 万升至 100 万,首发价输入每百万 2 美元、输出 10 美元,缓存输入享 95% 折扣。

  • 输出 token 上限从 6.4 万提升到 100 万,长流程任务一次跑完不用分段
  • 首发价输入每百万 2 美元、输出 10 美元,缓存输入打 95% 折扣,个人开发者用得起
  • 内部已用它把 C/C++ 迁到 Rust,libgav1 替换 3.2 万行 SIMD 后比原 Rust 版快 2.7 倍
查看原文 →
AIHacker News 高分 · 3 分钟

Cloudflare 发布开放权重决策模型 Clef

Cloudflare 推出开放权重决策模型 Clef 及 RL 微调平台,408 分登上 HN 热榜,个人开发者可自部署调优。

  • Cloudflare 发布 Clef 开放权重决策模型,主打决策类任务而非通用对话
  • 同步上线 RL 微调平台,开发者可用自己的数据做强化学习调优
  • HN 408 分、157 条评论,讨论集中在开放权重能否挑战闭源模型
查看原文 →
创业Hacker News 高分 · 3 分钟

向量数据库已死?turbopuffer 创始人开炮

turbopuffer 博客称专用向量数据库正在被通用数据库吸收,266 分登上 HN 首页,独立开发者选型需重新思考。

  • turbopuffer 发文《RIP, vector database》,主张向量检索正被 Postgres 等通用库吞并
  • HN 上 266 分、76 条评论,争论焦点是专用向量库是否还有独立商业价值
  • 对 solo founder 的启示:别再为 RAG 单独搭一套向量库,先用现成数据库扛住
查看原文 →
AIOpenAI Blog · 2 分钟

ChatGPT Work 帮小团队每周省出 10-15 小时

OpenAI 客户案例:The Den 用 ChatGPT Work 把拨款申请从 3 天压到 2 小时,酒牌材料从 4 天压到 3 小时。

  • The Den 是家社交俱乐部,开新店时用 ChatGPT Work 处理文书
  • 拨款申请从 3 天缩到 2 小时,酒牌材料从 4 天缩到 3 小时
  • 官方称每周省出 10-15 小时,相当于多出近两个工作日
查看原文 →
创业Hacker News 高分 · 2 分钟

开源地图编辑应用 StreetComplete 登陆 iOS 公测

开源众包地图工具 StreetComplete 结束安卓独占,正式在 iOS 开启公测,513 分登上 HN 热榜。

  • StreetComplete 是 OpenStreetMap 的众包编辑客户端,用户走路时顺手补全商店、路面等地图信息
  • 此前仅支持 Android,这次 iOS 公测由社区开发者推动,相关 issue 已讨论多年
  • HN 上 513 分、123 条评论,讨论集中在众包地图数据质量与移动端体验
查看原文 →
AIHugging Face Blog · 3 分钟

AI2 开源 Olmo-core 3,支持大规模 MoE 训练

Allen AI 发布 Olmo-core 3 训练框架,面向大规模混合专家模型,开源可复用,个人开发者也能跑 MoE。

  • AI2 发布 Olmo-core 3,专为大规模 MoE 模型训练设计,代码全开源
  • 支持分布式训练与显存优化,降低个人开发者跑 MoE 的门槛
  • 配套 Hugging Face 生态,可直接加载模型与数据集上手实验
查看原文 →
论文arXiv cs.AI · 3 分钟

AREX-2 用长程反思任务训练自改进智能体

arXiv 新论文提出 AREX-2,基于 Qwen3.8-27B 用长程反思数据训练,让智能体在测试时反复迭代自我改进,在多个基准上取得高分。

  • 核心思路是把反思和长程执行拆成两种可迁移能力,用机器学习与算法编程任务合成训练轨迹
  • 基于 Qwen3.8-27B 训练,MLE-bench Lite 得 81.8,Frontier-CS 得 70.7
  • 迁移到深度研究任务:BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8,且轮数越多分数越高
查看原文 →
AIHacker News 高分 · 3 分钟

Pi 1.0 发布:个人 AI 助手正式版上线

Pi 1.0 正式发布,HN 682 分 226 评论,个人 AI 助手从实验走向可用产品。

  • Pi 1.0 正式发布,HN 获 682 分、226 条评论,热度很高
  • 定位个人 AI 助手,主打持久记忆与个性化对话体验
  • 对独立开发者而言,是可直接体验和借鉴的 AI 产品案例
查看原文 →
工具BestBlogs 编程精选 · 2 分钟

PaperCut 两个 0Day 漏洞两天攻陷域控

黑客利用 PaperCut 打印服务器两个 0Day 漏洞获取高权限令牌,两天内横向移动攻陷域控制器并窃取全部密码哈希。

  • 漏洞编号 CVE-2024-45066 和 CVE-2024-45067,影响 PaperCut MF 与 NG 版本
  • 攻击者复制高权限服务账户令牌,无需密码即可横向移动到域控
  • eSentire 报告建议升级版本、限制访问、收缩服务账户权限并加强监控
查看原文 →
论文arXiv cs.AI · 3 分钟

AI导师如何应对学生卡壳:2万条对话研究

研究分析1260场真实化学辅导对话,发现学生每多卡一轮,下一轮恢复概率下降12.7%,直接指出错误比重复提问更有效。

  • 研究分析了20462条学生发言,识别出6630条卡壳轮次,分概念错误、表达不确定、求助三类
  • 每多一次卡壳,下一轮恢复几率降12.7%,脚本化提问效果随卡壳加深而衰减
  • 提问失败后重复提问恢复率28.1%,转而指出错误则达39.8%,差距明显
查看原文 →
创业Hacker News 高分 · 4 分钟

Rust 编译器提速方法更新,开发者实测分享

Rust 核心贡献者 nnethercote 发布 2026 年 9 月编译器提速技巧,HN 227 分 114 评论,对用 Rust 做独立产品的开发者有直接参考价值。

  • 作者 nnethercote 是 Rust 性能团队核心成员,长期维护编译器提速博客
  • HN 上 227 分、114 条评论,讨论集中在增量编译和链接优化
  • 内容偏工程实践,适合用 Rust 做 CLI 或后端服务的独立开发者
查看原文 →
论文arXiv cs.AI · 3 分钟

MoFlow:一次搜索生成多目标 Agent 工作流

arXiv 新论文提出 MoFlow,把 Agent 工作流生成建模为多目标马尔可夫决策过程,一次搜索覆盖 Pareto 前沿,偏好变化无需重训。

  • 传统方法只优化准确率或加权和,换偏好就得从头重训,MoFlow 用凸包蒙特卡洛树搜索一次搞定
  • 每个节点存一组可达权衡而非单一分数,支持准确率、成本、延迟、鲁棒性、一致性多目标
  • 在数学、代码、问答 6 个基准上对比 6 个基线,即便基线按每个偏好重跑仍拿下最高平均超体积
查看原文 →
论文BestBlogs AI 高分 · 3 分钟

何恺明团队用猫片预训练攻克 ARC 视觉推理

NAT-ARC 用 ImageNet MAE 预训练初始化视觉编码器,单模型 ARC-1 达 63.4%,集成后 70.2%,逼近 8B LLM 方案。

  • 复用何恺明 2022 年 MAE 公开 checkpoint,丢弃 patch embedding 改用 2D RoPE
  • 0.6B 单模型 ARC-1 63.4% pass@2,集成三策略后 70.2%,总参数约 2B
  • 预训练打通 scaling 瓶颈:无预训练 large 到 huge 掉点,有预训练三尺度一路上升
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

企业用上 AI 后,安全测试该测什么

AccessB 研讨会回顾:AI 接入业务后风险从模型输出扩展到数据泄露、Prompt 注入与 Agent 越权调用。

  • 风险面变了:不再只测模型答得对不对,还要测敏感数据泄露和 Prompt 注入
  • Agent 的工具调用可能越界,传统 Web 安全测试抓不到多轮交互里的权限偏移
  • 建议从高风险业务场景切入,按模型、数据、权限、执行链路四层逐步建评测体系
查看原文 →
AIOpenAI Blog · 2 分钟

OpenAI 谈 AI 与人类互补关系

OpenAI 官方博客发文探讨先进 AI 对突破性想法背后日常工作的价值,认为执行力将决定下一轮经济节奏。

  • OpenAI 官方博客 10 月 1 日发布《The eternal complement》一文
  • 核心观点:AI 最大价值在突破性想法背后的日常执行工作
  • 文章认为执行力而非创意本身,将决定下一轮经济增速
查看原文 →
论文arXiv cs.AI · 3 分钟

新方法让视觉模型OCR不再乱改原文

研究者提出GAD-RL,按学生模型表现动态调节蒸馏强度,在OCR忠实度基准上比GRPO高8.45个百分点。

  • 问题:视觉语言模型会把图片里的异常文字改写成通顺表达,导致OCR转录不忠实
  • GAD-RL在任务奖励超0.95时关闭蒸馏,并随组平均奖励升高持续衰减蒸馏强度
  • 在Qwen3.5-2B上,CHAOS-Bench微召回达59.92%,比GRPO+OPD高4.43个百分点
查看原文 →
论文arXiv cs.AI · 3 分钟

研究显示AI智能体可被彼此激进化

arXiv新论文模拟两个LLM对话,发现AI智能体易被同类说服走向极端,尤其当信息迎合其既有信念时。

  • 研究者让一个LLM扮演人类角色,另一个LLM专门把它的观点推向极端
  • 共鸣路径(强化已有信念)比说服路径(灌输新信念)效果强得多
  • 谄媚话术和未经证实的说法都能加剧激进化,且会扩散到相关信念
查看原文 →
论文arXiv cs.AI · 3 分钟

GFlowNet 生成多样合成对话数据新方法

研究者用生成流网络 GFlowNet 合成多样化专家对话数据,缓解模式坍塌,提升下游任务训练信号。

  • 传统提示 LLM 合成数据易模式坍塌,多样性低
  • GFlowNet 按训练数据中策略占比采样,覆盖更均衡
  • 在辅导与情感支持两领域,保真度和真实性优于 RL 基线
查看原文 →
查看全部往期