AIBestBlogs 编程精选 · 3 分钟
谷歌发布 Gemini 4 Argon,输出上限提至 100 万 token
Google DeepMind 推出前沿模型 Gemini 4 Argon,输出 token 上限从 6.4 万升至 100 万,首发价输入每百万 2 美元、输出 10 美元,缓存输入享 95% 折扣。
- 输出 token 上限从 6.4 万提升到 100 万,长流程任务一次跑完不用分段
- 首发价输入每百万 2 美元、输出 10 美元,缓存输入打 95% 折扣,个人开发者用得起
- 内部已用它把 C/C++ 迁到 Rust,libgav1 替换 3.2 万行 SIMD 后比原 Rust 版快 2.7 倍
查看原文 →AIHacker News 高分 · 3 分钟
Cloudflare 发布开放权重决策模型 Clef
Cloudflare 推出开放权重决策模型 Clef 及 RL 微调平台,408 分登上 HN 热榜,个人开发者可自部署调优。
- Cloudflare 发布 Clef 开放权重决策模型,主打决策类任务而非通用对话
- 同步上线 RL 微调平台,开发者可用自己的数据做强化学习调优
- HN 408 分、157 条评论,讨论集中在开放权重能否挑战闭源模型
查看原文 →创业Hacker News 高分 · 3 分钟
向量数据库已死?turbopuffer 创始人开炮
turbopuffer 博客称专用向量数据库正在被通用数据库吸收,266 分登上 HN 首页,独立开发者选型需重新思考。
- turbopuffer 发文《RIP, vector database》,主张向量检索正被 Postgres 等通用库吞并
- HN 上 266 分、76 条评论,争论焦点是专用向量库是否还有独立商业价值
- 对 solo founder 的启示:别再为 RAG 单独搭一套向量库,先用现成数据库扛住
查看原文 →AIOpenAI Blog · 2 分钟
ChatGPT Work 帮小团队每周省出 10-15 小时
OpenAI 客户案例:The Den 用 ChatGPT Work 把拨款申请从 3 天压到 2 小时,酒牌材料从 4 天压到 3 小时。
- The Den 是家社交俱乐部,开新店时用 ChatGPT Work 处理文书
- 拨款申请从 3 天缩到 2 小时,酒牌材料从 4 天缩到 3 小时
- 官方称每周省出 10-15 小时,相当于多出近两个工作日
查看原文 →创业Hacker News 高分 · 2 分钟
开源地图编辑应用 StreetComplete 登陆 iOS 公测
开源众包地图工具 StreetComplete 结束安卓独占,正式在 iOS 开启公测,513 分登上 HN 热榜。
- StreetComplete 是 OpenStreetMap 的众包编辑客户端,用户走路时顺手补全商店、路面等地图信息
- 此前仅支持 Android,这次 iOS 公测由社区开发者推动,相关 issue 已讨论多年
- HN 上 513 分、123 条评论,讨论集中在众包地图数据质量与移动端体验
查看原文 →AIHugging Face Blog · 3 分钟
AI2 开源 Olmo-core 3,支持大规模 MoE 训练
Allen AI 发布 Olmo-core 3 训练框架,面向大规模混合专家模型,开源可复用,个人开发者也能跑 MoE。
- AI2 发布 Olmo-core 3,专为大规模 MoE 模型训练设计,代码全开源
- 支持分布式训练与显存优化,降低个人开发者跑 MoE 的门槛
- 配套 Hugging Face 生态,可直接加载模型与数据集上手实验
查看原文 →论文arXiv cs.AI · 3 分钟
AREX-2 用长程反思任务训练自改进智能体
arXiv 新论文提出 AREX-2,基于 Qwen3.8-27B 用长程反思数据训练,让智能体在测试时反复迭代自我改进,在多个基准上取得高分。
- 核心思路是把反思和长程执行拆成两种可迁移能力,用机器学习与算法编程任务合成训练轨迹
- 基于 Qwen3.8-27B 训练,MLE-bench Lite 得 81.8,Frontier-CS 得 70.7
- 迁移到深度研究任务:BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8,且轮数越多分数越高
查看原文 →AIHacker News 高分 · 3 分钟
Pi 1.0 发布:个人 AI 助手正式版上线
Pi 1.0 正式发布,HN 682 分 226 评论,个人 AI 助手从实验走向可用产品。
- Pi 1.0 正式发布,HN 获 682 分、226 条评论,热度很高
- 定位个人 AI 助手,主打持久记忆与个性化对话体验
- 对独立开发者而言,是可直接体验和借鉴的 AI 产品案例
查看原文 →工具BestBlogs 编程精选 · 2 分钟
PaperCut 两个 0Day 漏洞两天攻陷域控
黑客利用 PaperCut 打印服务器两个 0Day 漏洞获取高权限令牌,两天内横向移动攻陷域控制器并窃取全部密码哈希。
- 漏洞编号 CVE-2024-45066 和 CVE-2024-45067,影响 PaperCut MF 与 NG 版本
- 攻击者复制高权限服务账户令牌,无需密码即可横向移动到域控
- eSentire 报告建议升级版本、限制访问、收缩服务账户权限并加强监控
查看原文 →论文arXiv cs.AI · 3 分钟
AI导师如何应对学生卡壳:2万条对话研究
研究分析1260场真实化学辅导对话,发现学生每多卡一轮,下一轮恢复概率下降12.7%,直接指出错误比重复提问更有效。
- 研究分析了20462条学生发言,识别出6630条卡壳轮次,分概念错误、表达不确定、求助三类
- 每多一次卡壳,下一轮恢复几率降12.7%,脚本化提问效果随卡壳加深而衰减
- 提问失败后重复提问恢复率28.1%,转而指出错误则达39.8%,差距明显
查看原文 →创业Hacker News 高分 · 4 分钟
Rust 编译器提速方法更新,开发者实测分享
Rust 核心贡献者 nnethercote 发布 2026 年 9 月编译器提速技巧,HN 227 分 114 评论,对用 Rust 做独立产品的开发者有直接参考价值。
- 作者 nnethercote 是 Rust 性能团队核心成员,长期维护编译器提速博客
- HN 上 227 分、114 条评论,讨论集中在增量编译和链接优化
- 内容偏工程实践,适合用 Rust 做 CLI 或后端服务的独立开发者
查看原文 →论文arXiv cs.AI · 3 分钟
MoFlow:一次搜索生成多目标 Agent 工作流
arXiv 新论文提出 MoFlow,把 Agent 工作流生成建模为多目标马尔可夫决策过程,一次搜索覆盖 Pareto 前沿,偏好变化无需重训。
- 传统方法只优化准确率或加权和,换偏好就得从头重训,MoFlow 用凸包蒙特卡洛树搜索一次搞定
- 每个节点存一组可达权衡而非单一分数,支持准确率、成本、延迟、鲁棒性、一致性多目标
- 在数学、代码、问答 6 个基准上对比 6 个基线,即便基线按每个偏好重跑仍拿下最高平均超体积
查看原文 →论文BestBlogs AI 高分 · 3 分钟
何恺明团队用猫片预训练攻克 ARC 视觉推理
NAT-ARC 用 ImageNet MAE 预训练初始化视觉编码器,单模型 ARC-1 达 63.4%,集成后 70.2%,逼近 8B LLM 方案。
- 复用何恺明 2022 年 MAE 公开 checkpoint,丢弃 patch embedding 改用 2D RoPE
- 0.6B 单模型 ARC-1 63.4% pass@2,集成三策略后 70.2%,总参数约 2B
- 预训练打通 scaling 瓶颈:无预训练 large 到 huge 掉点,有预训练三尺度一路上升
查看原文 →工具BestBlogs 编程精选 · 3 分钟
企业用上 AI 后,安全测试该测什么
AccessB 研讨会回顾:AI 接入业务后风险从模型输出扩展到数据泄露、Prompt 注入与 Agent 越权调用。
- 风险面变了:不再只测模型答得对不对,还要测敏感数据泄露和 Prompt 注入
- Agent 的工具调用可能越界,传统 Web 安全测试抓不到多轮交互里的权限偏移
- 建议从高风险业务场景切入,按模型、数据、权限、执行链路四层逐步建评测体系
查看原文 →AIOpenAI Blog · 2 分钟
OpenAI 谈 AI 与人类互补关系
OpenAI 官方博客发文探讨先进 AI 对突破性想法背后日常工作的价值,认为执行力将决定下一轮经济节奏。
- OpenAI 官方博客 10 月 1 日发布《The eternal complement》一文
- 核心观点:AI 最大价值在突破性想法背后的日常执行工作
- 文章认为执行力而非创意本身,将决定下一轮经济增速
查看原文 →论文arXiv cs.AI · 3 分钟
新方法让视觉模型OCR不再乱改原文
研究者提出GAD-RL,按学生模型表现动态调节蒸馏强度,在OCR忠实度基准上比GRPO高8.45个百分点。
- 问题:视觉语言模型会把图片里的异常文字改写成通顺表达,导致OCR转录不忠实
- GAD-RL在任务奖励超0.95时关闭蒸馏,并随组平均奖励升高持续衰减蒸馏强度
- 在Qwen3.5-2B上,CHAOS-Bench微召回达59.92%,比GRPO+OPD高4.43个百分点
查看原文 →论文arXiv cs.AI · 3 分钟
研究显示AI智能体可被彼此激进化
arXiv新论文模拟两个LLM对话,发现AI智能体易被同类说服走向极端,尤其当信息迎合其既有信念时。
- 研究者让一个LLM扮演人类角色,另一个LLM专门把它的观点推向极端
- 共鸣路径(强化已有信念)比说服路径(灌输新信念)效果强得多
- 谄媚话术和未经证实的说法都能加剧激进化,且会扩散到相关信念
查看原文 →论文arXiv cs.AI · 3 分钟
GFlowNet 生成多样合成对话数据新方法
研究者用生成流网络 GFlowNet 合成多样化专家对话数据,缓解模式坍塌,提升下游任务训练信号。
- 传统提示 LLM 合成数据易模式坍塌,多样性低
- GFlowNet 按训练数据中策略占比采样,覆盖更均衡
- 在辅导与情感支持两领域,保真度和真实性优于 RL 基线
查看原文 →