2026-09-21

星期一 · 39
工具BestBlogs 编程精选 · 2 分钟

PixelRAG 用截图做检索,已获万星

伯克利团队开源 PixelRAG,把网页和 PDF 渲染成截图再检索,保留表格图表版式,已获 10000+ Star。

  • 放弃文本切块,直接把网页和 PDF 渲染成截图,在图上做检索
  • 已建好维基百科 828 万页索引,免配置免密钥即可调用
  • Mac M 系列建一份 PDF 索引约 3 分钟,无需显卡,还配 Claude Code 插件
查看原文 →
AIBestBlogs AI 高分 · 2 分钟

Laya 开源:421M 参数 33 毫秒完成决策

Convai Innovations 开源 421M 参数非自回归决策模型 Laya,33 毫秒完成分类,准确率超闭源 Jev,Apache 2.0 可本地部署。

  • 421M 参数基于 ModernBERT,33~38 毫秒出结果,比 Jev 快约 4 倍
  • 意图路由准确率 99.1%,ECE 仅 0.009,概率经过数学校准
  • Apache 2.0 开源可本地跑,适合邮件分流、内容审核等场景
查看原文 →
AIBestBlogs 编程精选 · 4 分钟

Agent 正在取代开发者成为技术选型决策者

RedMonk 创始人指出 Agent 已开始自主选择语言、框架和库,开发者从造王者变成顾问,权力结构正在反转。

  • Neon 上 Agent 创建数据库实例占比从 30% 涨到 80%,Vercel 上 Agent 触发部署从不足 3% 升到过半
  • Shopify 因 Agent 偏好放弃 React Native 转原生,厂商开始做 Agent 优先而非人类优先
  • 作者提出三条路:融入人类工作流、完全面向 Agent、或两者兼顾,但 Agent 关系只需影响少数模型
查看原文 →
创业Hacker News 高分 · 4 分钟

Sun 前工程师复盘:技术领先为何输掉市场

Sun 前核心工程师 Bryan Cantrill 撰文复盘公司失败原因,477 分登上 HN 首页,引发 263 条讨论。

  • 作者 Bryan Cantrill 是 DTrace 创造者,在 Sun 工作 14 年,亲历从巅峰到卖身 Oracle
  • 文章核心论点:Sun 技术不差,输在商业模式和定价,而非工程能力
  • HN 477 分 263 评论,讨论集中在「技术好但不会卖」这个创业老问题
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

Hugging Face tokenizers v1 重构提速 30 倍

Hugging Face 发布 tokenizers v1,API 不变但编码提速 3-30 倍,对本地跑模型的独立开发者是免费升级。

  • 用 bitcannon 的 SIMD 位流替代正则做预切分,控制流开销大幅下降
  • 基于 BPE 确定性的词缓存跳过重复计算,重复文本场景收益最大
  • 零分配、无分支的 merge loop 优化内存与 CPU 分支预测,API 完全兼容
查看原文 →
AIBestBlogs AI 高分 · 4 分钟

10人团队靠AI做出百人增长的企业服务逻辑

深演智能黄晓南谈企业级AI落地:大模型拿不到企业私有数据与工作流,这三点才是护城河,10人可做100人的增长。

  • FDE前线部署工程师60-70%权重在业务理解,而非纯技术能力
  • 大模型无法获取企业私有数据、内部知识和真实工作流,这是核心护城河
  • 创业者应与大模型建立垂直关系而非平行关系,避免被其能力吞噬
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

勒索软件转向攻击AI模型与算力资产

Sysdig发现JADEPUFFER组织用AI Agent驱动勒索攻击,专攻LoRA适配器、模型权重等AI资产,重建成本最高达50万美元。

  • 攻击者利用Langflow未认证RCE漏洞CVE-2025-3248入侵,横向移动后加密1342项配置
  • 新型勒索软件ENCFORGE用Go编写,针对近180种AI扩展名,含LoRA、向量索引与训练数据
  • 重建生产级微调模型成本约7.5万至50万美元,传统备份策略因大文件排除而失效
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

火山引擎 AI MediaKit 实现视频字幕无痕擦除

火山引擎推出 AI MediaKit,用多模态理解区分该擦和该留的文字,再用自研 ReFM 修复画面,支持 50 多种语种。

  • 传统 OCR 加像素擦除分不清花字、水印和招牌等场景固有文字,容易误擦
  • 方案先用多模态理解判断文字角色,语义不明时保守保留,再用 ReFM 残差流匹配修复
  • 4 步采样完成修复,支持长视频重叠窗口处理和 50 多种语种,服务短剧出海等场景
查看原文 →
创业Hacker News 高分 · 4 分钟

注意力是你唯一真正的资产

一篇 HN 热文提出:一人公司最稀缺的不是时间而是注意力,544 分 155 条评论引发热议。

  • 作者 alicegg 认为时间对所有人公平,注意力才是可被主动配置的稀缺资源
  • HN 上 544 分、155 条评论,讨论集中在如何拒绝会议和碎片化干扰
  • 对 solo founder 的启发:把注意力当预算管理,而非用日程表填满时间
查看原文 →
论文arXiv cs.AI · 3 分钟

免训练稀疏注意力让长文本预填充提速20倍

arXiv新论文提出RBS-Attention,无需训练即可在128K上下文下把预填充注意力提速20倍,精度几乎不降。

  • 在H100上跑Qwen3-30B,128K上下文预填充注意力提速20.65倍,vLLM场景提速11.92倍
  • 端到端首token时间缩短5.97倍,密集Qwen3-32B上RULER准确率88.65对89.52
  • 方法免训练,靠双分支选择解决块质心掩盖关键token的均值稀释问题
查看原文 →
工具BestBlogs 编程精选 · 2 分钟

RPent 开源:机器人 Agent 分工提速 7 倍

开源机器人基础设施 RPent 把 Agent 分工模式搬到具身智能,200 次评测端到端加速约 7 倍,兼容多种真机。

  • 通用大模型负责规划,专用操作模型做抓取插拔等精细动作
  • 官方 200 次评测平均耗时从 283.6 秒降到 40.9 秒,加速约 7 倍
  • 记忆机制让物体被调换位置的任务成功率从 31% 提升到 87%
查看原文 →
创业BestBlogs 商业产品 · 5 分钟

腾讯团队用状态文件驱动AI全流程开发

腾讯应用宝团队把AI编码升级为端到端自动化系统,覆盖需求拆解到代码提交,值得独立开发者借鉴其工程思路。

  • 团队为90+微服务、800+文档建知识库,用Skill自动生成8类结构化文档
  • 以状态文件为唯一真相源,配hook机制强制流程推进,设计12个专家Agent
  • 通过DAG编排与Fork-Join实现多任务并行,集成TAPD等内部平台打通DevOps
查看原文 →
AIOpenAI Blog · 2 分钟

Higgsfield 用 GPT-6 Astra 一天上线视频新功能

OpenAI 官方博客披露,Higgsfield AI 借助 GPT-6 Astra 在一天内完成视频广告新功能开发,小商家可更快出片。

  • Higgsfield AI 用 GPT-6 Astra 把视频广告新功能从开发到上线压缩到 1 天
  • 目标用户是小商家,主打零门槛生成视频广告素材
  • 案例来自 OpenAI 官方博客,属于一手客户故事而非二手转述
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

星际争霸AI测试:主流大模型全败给新手

Brood War Bench 让主流大模型以智能体形式打星际争霸,结果全部没超过人类新手,暴露实时决策短板。

  • Codex Astra 18 场全胜,但靠工人骚扰,经济和正面作战很弱
  • Claude Fable 胜率 83.3%,会发展经济爬科技树,最像在认真打
  • Grok 一局 43 分钟输出 11000+ 推理 token 却只发 6 批操作,全程没造兵
查看原文 →
AIOpenAI Blog · 2 分钟

V7 用 GPT-5.6 给 AI 智能体装上机构记忆

OpenAI 博客介绍 V7 用 GPT-5.6 把公司散落文件变成可溯源上下文,让智能体完成复杂任务,对一人公司知识管理有参考价值。

  • V7 基于 GPT-5.6,把公司散落文件整理成智能体可用的上下文
  • 强调 source-linked,输出结果能追溯到原始文件来源
  • 面向复杂任务场景,适合把个人知识库交给 AI 打理
查看原文 →
AIBestBlogs 编程精选 · 3 分钟

HN 热榜:Qwen 开源图像模型与 RSA-896 被破解

本期 HN 热榜聚焦 Qwen 开源 7B 图像模型、ChatGPT 广告追踪争议,以及 GPU 集群 10 天破解 RSA-896 的密码学进展。

  • Qwen 开源 7B 图像模型 Qwen-Image-2.1,统一生成与编辑,原生支持透明图,但许可证更严
  • 有人用 2048 块 GPU 跑 10 天分解 RSA-896,说明 RSA-1024 对数据中心级攻击者已脆弱
  • Pirate Face 把 Hugging Face 模型转成磁力链接去中心化保存,防止被下架
查看原文 →
工具BestBlogs 编程精选 · 8 分钟

Loop engineering:把 agent 放进工程循环

文章系统拆解 Loop engineering 理念,提出工程循环的六个必备动作与六大支撑组件,并给出自动化判定标准、失败模式与权限分层建议。

  • 一个可工作的工程 loop 至少包含读取状态、判断、执行、验证、写入、停止六个动作
  • 六大组件:Automations、Worktrees、Skills、Plugins、Sub-agents、Memory
  • 给出 CI triage、review comment、harness maintenance 三个可落地示例
查看原文 →
AIHugging Face Blog · 3 分钟

Hugging Face 发布 tokenizers v1 性能实测

Hugging Face 推出 tokenizers v1,官方实测编码解码速度与扩展性,直接影响本地跑模型的开发者。

  • tokenizers v1 正式发布,主打 encode/decode 速度与扩展性提升
  • 官方博客给出实测数据,对比旧版在吞吐和内存上的表现
  • 对本地跑 LLM、做数据预处理的独立开发者是直接可用的升级
查看原文 →
AIHacker News 高分 · 3 分钟

Fable 5 数据揭示八月模型思考质量下滑

Hacker News 热帖讨论 Fable 5 数据显示八月模型平均思考能力下降,引发 230 条评论热议,对依赖 AI 的独立开发者有直接影响。

  • Fable 5 统计显示八月模型平均思考质量出现下滑,336 分登上 HN 热榜。
  • 帖子引发 230 条评论,开发者猜测与训练数据或推理预算调整有关。
  • 对靠 AI 写代码、做内容的 solo founder 来说,输出稳定性需重新评估。
查看原文 →
AIHugging Face Blog · 3 分钟

物理学家式剪枝:把 LLM 块移除当伊辛问题

Hugging Face 博客介绍用伊辛优化做 LLM 结构化剪枝,把移除哪些块变成组合优化,给个人开发者省显存提供新思路。

  • 方法把 LLM 的块移除建模成伊辛优化问题,用物理退火思路找最优剪枝组合
  • 相比逐层重要性打分,组合优化能兼顾块之间的相互影响,剪得更狠
  • 发布在 Hugging Face 博客,附代码与实验,适合本地小显存跑大模型的场景
查看原文 →
AIBestBlogs AI 精选 · 4 分钟

从 KV cache 反推 coding agent 的六个设计怪象

TypeSafe CEO 用反事实实验指出,路由、工具调用、compaction 等 agent 标准特性多是 KV cache 成本结构的补丁,而非最优设计。

  • 按难度路由经济上不成立:cache 按模型隔离,小模型读大模型上下文要全价,回切还要重付输入费
  • compaction 隐含「所有 turn 共享同一状态」的可疑假设,子 agent 卡在状态交接
  • 解法是显式状态加按查询动态重建上下文,对复用 cache 还是从零重建做成本感知决策
查看原文 →
工具Hacker News 高分 · 2 分钟

苹果官方指南教你关闭 Mac 上的 Apple Intelligence

苹果支持文档登上 HN 热榜,227 分 147 评论,说明不少开发者想关掉系统级 AI 功能。

  • 苹果官方支持页给出在 Mac 上关闭和限制 Apple Intelligence 的完整步骤
  • HN 上 227 分、147 条评论,讨论热度集中在隐私和系统资源占用
  • 对把 Mac 当主力开发机的独立开发者,这是一份可照做的配置清单
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

Boltzbit 提出无限参数 LLM:动态 LoRA 持续学习

Boltzbit 与剑桥团队用超网络动态生成 LoRA 权重,让模型在长文档和多轮对话中持续学习,成本固定。

  • 超网络按输入实时生成 LoRA 权重,不预存固定专家,突破 MoE 路由上限
  • 贝叶斯机制让上下文理解随对话轮次递增,每轮算力保持固定
  • 三组实验显示长文档、多干扰项、多轮对话均优于传统提示工程
查看原文 →
AIOpenAI Blog · 2 分钟

OpenAI 学院新增多条 AI 学习路径

OpenAI 学院面向员工、开发者、管理者和学生推出新学习路径,帮助系统掌握实用 AI 技能。

  • 覆盖开发者、管理者、教育者、学生等 5 类人群,路径按角色划分
  • 内容聚焦实际动手能力,而非单纯理论讲解
  • 免费开放,适合 solo founder 补齐 AI 应用技能
查看原文 →
AIHacker News 高分 · 3 分钟

Kev:基于Qwen3.5的轻量决策模型家族

开发者Jared Palmer发布Kev,一组类似Jev的微型决策模型,基于Qwen3.5构建,HN获392分175评论。

  • 作者Jared Palmer是Vercel早期员工、Turborepo作者,开源项目可信度较高
  • 模型定位是"决策"而非通用对话,主打小体积、可本地跑,适合嵌入产品
  • HN 392分175评论,讨论热度高,但仓库刚发布,生态和文档还在早期
查看原文 →
AIHacker News 高分 · 2 分钟

xAI 发布 Grok 4.7,登顶 HN 热榜

xAI 推出 Grok 4.7 模型,官方公告在 Hacker News 获 467 分、382 条评论,成为当日最热讨论之一。

  • xAI 官方发布 Grok 4.7,公告页挂在 x.ai/news 一手渠道
  • HN 讨论热度 467 分、382 条评论,开发者关注度极高
  • 具体能力与定价未在摘要中给出,需点进原文确认
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

清华开源 RPent:具身智能体提速 7 倍

清华、无问芯穹等联合开源具身智能体基础设施 RPent,任务速度提升约 7 倍,成功率 92.6%。

  • 清华、无问芯穹、正行创新联合开源 RPent,面向真实物理世界
  • Flash Mode 复用已验证流程,平均执行时间从 283.6 秒降到 40.9 秒
  • 三层记忆把位置交换任务成功率从 31% 拉到 87%,LIBERO-Pro 达 92.63%
查看原文 →
AIBestBlogs 商业产品 · 3 分钟

达摩院医疗AI十年:一张CT查146种病

阿里达摩院推出通用医疗影像模型RADAR登上Science,在腹部增强CT上识别146种病症,读片能力超过26名医生中的23人。

  • RADAR在4万真实检查中平均AUC 0.913,外部验证0.895,具备零样本诊断能力
  • 胰腺癌筛查模型PANDA把误报率压到千分之一,宁波落地24万例发现84例胰腺癌
  • 一次200元平扫CT替代3000元七癌筛查组合,专病与通用模型将长期并行
查看原文 →
AIHacker News 高分 · 2 分钟

小米发布 MiMo v2.6 模型,登顶 HN 热榜

小米 MiMo v2.6 在 Hacker News 获 423 分、211 条评论,是当天热度最高的 AI 发布之一。

  • 小米 MiMo v2.6 上线,官方页面 mimo.xiaomi.com 直接放出模型信息
  • HN 上 423 分、211 条评论,讨论热度超过多数开源模型发布
  • 小米持续加码 AI 模型,对个人开发者意味着又多一个可选底座
查看原文 →
工具Product Hunt · 2 分钟

Google Flow AI 创作工作室登陆 iOS 与 Android

Google 旗下 AI 创意工作室 Flow 正式推出移动端 App,独立创作者可随时用手机生成和编辑 AI 内容。

  • Flow 原本是 Google 面向创作者的 AI 视频/图像生成工具,现在补齐 iOS 和 Android 双端。
  • 移动端意味着不用开电脑,通勤或外拍现场就能直接出片,适合一人内容团队。
  • 目前 Product Hunt 上讨论量一般,具体免费额度和订阅价格官方还没在页面说明。
查看原文 →
AIBestBlogs AI 高分 · 2 分钟

傅盛谈 Jev 模型:非生成式 AI 的落地场景

傅盛指出 Jev 不生成文字,但速度快、成本极低、零幻觉,适合代码审查和风险判断等高频任务。

  • Jev 与 GPT、Claude 本质不同,不生成文字,不能聊天或写代码
  • 优势是速度快、成本极低、零幻觉,适合高频判断类任务
  • 傅盛建议企业按模型特长分配任务,如审代码、结果评分、客服风控
查看原文 →
论文arXiv cs.AI · 3 分钟

AI精神科问诊质量评估平台发布

研究者推出InterviewPlayground平台,用模拟患者评估AI问诊质量,发现GPT问诊信息覆盖率高但安全风险识别不足。

  • 平台用记忆增强模拟患者,支持开放式AI问诊评估
  • 6名临床医生25分钟测试,GPT问诊覆盖88%临床信息
  • 但GPT安全风险识别率仅33%,低于医生的67%
查看原文 →
论文arXiv cs.AI · 3 分钟

TinyCeNN-LM:用质量门控替换注意力层

arXiv新论文提出质量门控转换框架,把预训练模型的注意力层换成类细胞神经网络层,只在指标达标时接受替换。

  • 在SmolLM2-135M上,前3层被接受,累计NLL仅涨0.01209,第4层因表示保真度不达标被拒
  • 在Qwen3.5-0.8B上,第3、7、11层全注意力层被接受,最终NLL涨0.02073
  • Integrated Memory方案把困惑度控制在-0.07%到+0.93%之间,总缓存最多减少6.01%
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

OpenAI 称攻克千禧年难题,27 位菲尔兹奖得主联名质疑

OpenAI 宣称内部模型解决纳维-斯托克斯方程及超 100 个数学开放问题,27 位菲尔兹奖得主发公开信质疑其跳过方法提炼与引用。

  • OpenAI 称 8 月 28 日起训练的内部模型解出纳维-斯托克斯方程,该题悬赏 100 万美元
  • 9 月 11 日陶哲轩、Peter Scholze 等 27 位菲尔兹奖得主联名质疑 AI 把开放问题当跑分
  • OpenAI 成立挂靠普林斯顿高等研究院的 AGMAI 顾问组,成员不拿钱可公开批评
查看原文 →
论文arXiv cs.AI · 3 分钟

微调改变大模型内部表征,但与任务关键组件无关

arXiv 新论文发现,微调对 LLM 内部表征的改动,与真正驱动任务表现的注意力头几乎不重叠,任务间还可能互相拖累。

  • 研究用 EAP 定位关键注意力头,发现它们集中在少数层,存在功能局部化
  • 表征变化最大的层,和 EAP 关键层几乎不相关,说明改动大不等于有用
  • 两个任务关键组件重叠度高时,微调一个反而会拉低另一个的表现
查看原文 →
创业Hacker News 高分 · 2 分钟

NASA火星采样返回任务宣告终止

NASA火星样本返回任务因预算超支被正式取消,已采集的岩石样本将滞留火星,商业航天或迎机会。

  • 该任务原计划耗资超110亿美元,时间表一再推迟,最终被砍
  • 毅力号已在火星采集数十管岩芯样本,如今无法送回地球
  • 评论热议商业航天公司能否以更低成本接手采样返回
查看原文 →
工具Product Hunt · 2 分钟

NiubiGEO:开源AI可见度监测工具上线

Product Hunt 上出现开源工具 NiubiGEO,主打 AI 可见度追踪加人工增长服务,帮小团队看自己在 AI 搜索里的曝光。

  • NiubiGEO 在 Product Hunt 发布,定位开源 AI 可见度监测工具
  • 卖点是 open-source 加 human-powered growth,人工介入增长环节
  • 目前只有一句简介,定价、功能细节和 GitHub 地址都还没公开
查看原文 →
论文arXiv cs.AI · 3 分钟

MoE路由新方法AAR:冻结主干只训路由,GSM8K涨3.37分

arXiv新论文提出Attention-Aware Routing,用注意力权重窗口特征增强MoE路由器,冻结主干只训路由参数,数学推理提升3.37个百分点。

  • 在OLMoE上,冻结整个Transformer只训练路由参数,GSM8K准确率比仅路由SFT基线高3.37个百分点。
  • 发现路由与注意力是耦合回路:第l层路由变化会经残差流放大第l+1层注意力汇,无需改动注意力机制。
  • AAR对深度敏感,深层引入提升数学推理,但全层滥用会损害事实检索,暴露检索与推理的张力。
查看原文 →
论文arXiv cs.AI · 3 分钟

用拓扑曲率检测大模型幻觉的新方法

研究者用Forman-Ricci曲率分析注意力图,发现幻觉与上下文共享受阻强相关,单次推理即可检测。

  • 幻觉回答在最后一层Transformer里过度依赖自注意力,上下文检索分散
  • 方法叫拓扑签名检测,单次前向传播就能跑,比多响应基线更省算力
  • 在多个LLM和两个幻觉检测基准上验证,跨架构表现稳定
查看原文 →
查看全部往期