工具Hacker News 高分 · 2 分钟
Capsule:把网页应用和数据打包进单个 SQLite 文件
开发者用 Rust 和 Tauri 2.0 做了 Capsule,把 HTML 应用与数据塞进一个 SQLite 文件,免服务器即可分发和保存数据。
- HTML 和资源直接嵌进 SQLite,数据用 localStorage 或类 MongoDB 集合 API 存表里
- 文档默认无文件系统权限,联网需授权,可调用本地或远程 AI 模型
- 每条数据带 UUID 和时间戳,方便合并多人各自修改的副本,1.0 将开放文件格式
查看原文 →AIBestBlogs AI 高分 · 2 分钟
Devin 新增 Mac 虚拟机,全自动构建 iOS 应用
Cognition 为 AI 程序员 Devin 配备专用 Mac 虚拟机,可独立跑 Xcode、模拟器测试并生成 TestFlight 链接。
- Devin 现在能自己打开 Xcode,在 iOS 模拟器里跑代码和测试
- 完成后自动录屏,通过 Slack 把结果和 TestFlight 链接发给你
- 从一句 prompt 到手机上可安装的 App,中间不用人插手
查看原文 →创业Hacker News 高分 · 2 分钟
墨水屏相框听鸟鸣,自动绘制19世纪插画
开发者用墨水屏做了一款听鸟叫的相框,识别鸟种后自动生成1800年代风格的鸟类插画,HN获1208分。
- 硬件是墨水屏相框,内置麦克风实时监听窗外鸟鸣
- 识别鸟种后用AI生成19世纪博物学插画风格图像
- GitHub开源项目fugleramme,HN 1208分167条评论
查看原文 →论文arXiv cs.AI · 3 分钟
ZGCM-1:7B开源模型数学推理媲美千亿级
一个从零训练的7B全开源模型,在数学推理和智能体搜索上对标Qwen3-235B,并公开全部训练细节。
- 7B稠密模型支持256K上下文,数学与Agent搜索能力对标Qwen3-235B、GLM-5.1
- 16K预训练时间到损失效率提升约4.2倍,采用FP8 Muon优化器
- 开源权重、中间checkpoint、训练代码、数据配方和W&B日志全公开
查看原文 →AIBestBlogs 编程精选 · 4 分钟
提示词不是越长越好,研究给出停手信号
文章梳理多项研究:长上下文会降低代码审计通过率,Claude Code 砍掉 80% 系统提示词后评测无损失,提示词该按需加载而非堆砌。
- 代码审计研究显示长上下文降低通过次数,加明确检查清单后回升,但每组仅 10 次属小样本
- Anthropic 报告 Claude Code 移除超 80% system prompt,内部评测无可测损失
- 改动分三类验证:补必要条件、删重复冲突、专用资料改按需加载,以任务结果而非字数判断
查看原文 →创业BestBlogs 商业产品 · 6 分钟
庄明浩73页PPT复盘AI季度变局
庄明浩用73页PPT梳理AI行业一个季度变化,提出从模型竞争转向拥有自己的智能,对独立开发者判断方向有参考价值。
- 四章结构:模型狂奔、智能分化、循环自生、界面重构,覆盖一个季度全貌
- Stripe 收购 OpenRouter、英伟达收购 Hugging Face,中间层节点被巨头收编
- 119 家 new lab 融资 943 亿美金,仅 16 家披露收入,泡沫信号明显
查看原文 →AIBestBlogs AI 高分 · 2 分钟
OpenAI 开源资助翻倍至 1 万个名额
OpenAI 将 Codex for OSS 计划名额从 5000 翻倍到 10000,入选开源维护者可免费用 6 个月 ChatGPT Pro。
- 名额从 5000 翻倍到 10000,入选者拿 6 个月 ChatGPT Pro
- 额外送 Codex Security 权限和自动化维护 API 额度
- 项目需活跃且有实际使用量,上轮获资助者也能再申请
查看原文 →工具BestBlogs 编程精选 · 3 分钟
GitHub 8 个热门开源项目盘点
本周 GitHub 热门项目涵盖 3D 数据可视化、视频自动化、Claude Code 技能库与多 Agent 协作框架,独立开发者可直接取用。
- HeyGen 开源 HyperFrames,用网页代码编排直接导出 MP4 视频
- Chrome 团队开源 DevTools MCP,让 AI 直接操作浏览器调试
- HumanLayer 沉淀 5 个 Claude Code Skill,含多 Agent 协作框架 Ruflo
查看原文 →工具BestBlogs 编程精选 · 2 分钟
无问芯穹开源具身端侧推理引擎 APXInf
无问芯穹联合清华、上交开源 APXInf,在 Jetson Thor 上跑 PI 0.5 模型把反应时间从 278ms 压到 26ms,提速 10.7 倍。
- 官方实测 Jetson Thor 跑 PI 0.5,反应时间 278ms 降到 26ms 以内
- 支持 PI 0.5 和 WALL-OSS,可在 RTX 4090、Jetson Orin/Thor 直接部署
- 与去年开源的训练框架 RLinf 同生态,训练到部署一条工具链搞定
查看原文 →创业BestBlogs 商业产品 · 8 分钟
家得宝四十年:从被解雇到零售巨头
Acquired 复盘家得宝 1978 年至今的商业史,拆解仓储式家装零售的规模经济护城河与两次管理危机。
- 1978 年伯尼·马库斯与阿瑟·布兰克被 Daylin 解雇,靠 Ken Langone 拉 40 位投资人凑资起步
- 1979 年亚特兰大同日开两家店,用低毛利、海量 SKU 和「货堆得高、走得飞快」建模式
- 后期 Bob Nardelli 集中化砍一线员工毁文化,Frank Blake 靠电商与门店自提重建增长
查看原文 →创业BestBlogs 商业产品 · 5 分钟
xLean 薛轲翰:清洁机器人是家庭 Agent 起点
xLean 推出双形态洗地机器人 TR1,用手持模式采集示范数据做清洁闭环,再扩展成家庭 Agent 生态。
- TR1 是全球首款双形态洗地机器人,能自主清洁也能变身手持洗地机
- 创始人薛轲翰认为传统扫地机是开环,TR1 靠用户手持操作采集识别、策略、结果数据
- 终极愿景是通用家庭机器人,用 PAI 协议和 EvoMate OS 接入净化、巡检、机械臂模块
查看原文 →AIBestBlogs AI 高分 · 3 分钟
用 MCP 插件让 ChatGPT 直读服务器日志
作者把服务器日志、数据表和 GitHub PR 封装成只读 MCP 插件,在网页版 ChatGPT 里分析项目,不消耗 Codex 额度。
- 把服务器日志、数据表、GitHub PR 记录打包成一个只读 MCP 插件
- 加载到网页版 ChatGPT 后,GPT-6 Pro 可直接分析项目数据
- 走网页版而非 Codex 接口,省下 200 美元档位的额度消耗
查看原文 →AIHacker News 高分 · 3 分钟
谷歌发布 Gemini 3.8 Live 与扩展思考版
谷歌推出 Gemini 3.8 Live 及 Extended Thinking 版本,主打实时交互与深度推理,HN 242 分 169 评论热议。
- 谷歌发布 Gemini 3.8 Live,支持实时多模态交互,面向语音与视频场景
- 同步推出 Extended Thinking 版,主打复杂推理,对标 OpenAI o 系列
- HN 上 242 分 169 条评论,开发者关注定价与 API 可用性
查看原文 →AIBestBlogs AI 高分 · 3 分钟
荣耀 MagicOS 11 让 YOYO 执行 100 步任务
荣耀发布 MagicOS 11,YOYO 智能体任务链从 14 步拉到 100 步以上,闭环率 90%,开放 700 个工具与 500 个 Skills。
- YOYO Harness 把意图理解做到 91.8%,长链任务从 14 步提升到 100 步以上
- 可调用工具从 400 个增至 700 个,任务闭环率 90%,接入 1 万多个第三方 AI 服务
- 支持 MCP、A2A、Skills、GUI 多接口,并公布 AgenticOS 路线图
查看原文 →AIBestBlogs AI 高分 · 4 分钟
构建可追溯文档问答 Agent 的工程指南
文章提出把 RAG 当作可调试管道,从解析、索引到引用验证三环节提升文档问答可靠性。
- 核心观点:解析质量决定 RAG 输出天花板,后端 Prompt 调优救不了源头数据缺陷
- 建议拆成云端解析、本地索引、引用验证三段,每段都可单独调试
- 用引用机制和验证 UI 把黑盒 RAG 变成可归因、可审计的系统
查看原文 →AIHugging Face Blog · 3 分钟
IBM 新研究:Agent 一次成功不代表稳定
IBM Research 在 Hugging Face 发布 ALTK-Evolve,指出 Agent 单次通过任务不等于可重复,稳定性才是生产可用关键。
- IBM Research 提出 ALTK-Evolve,专门测 Agent 的重复一致性,而非只看单次成功率
- 核心观点:一次跑通可能是运气,同一任务多次执行结果波动才是真问题
- 对做 Agent 产品的独立开发者,评测标准要从「能不能做」转向「能不能稳定做」
查看原文 →创业Hacker News 高分 · 3 分钟
互联网档案馆更新 Wayback Machine 访问政策
互联网档案馆发布 Wayback Machine 访问更新,回应近期服务中断与法律压力,影响依赖存档链接的开发者。
- 官方博客 9 月 15 日发文,更新 Wayback Machine 访问状态
- HN 上 318 分、172 条评论,社区关注度很高
- 对靠存档链接做内容溯源、爬虫回填的独立开发者影响直接
查看原文 →工具Product Hunt · 2 分钟
Fide Island 把 Mac 刘海变成效率控制台
Product Hunt 新上架 Fide Island,把媒体控制、笔记和本地翻译塞进 MacBook 刘海,面向重度 Mac 用户。
- 功能覆盖媒体播放控制、快速笔记、设备端翻译,全部集中在刘海区域
- 主打 on-device 翻译,不联网也能用,隐私敏感场景更友好
- 目前仅在 Product Hunt 上线,讨论区热度一般,属于早期尝鲜阶段
查看原文 →论文arXiv cs.AI · 3 分钟
LLM 评审专利撰写:便宜模型也能逼近贵模型
arXiv 新论文用专利撰写测试台验证 LLM 评审,发现迭代反馈能让低推理模型接近高推理模型水平。
- 论文构建 Vibe Patenting 测试台,让 LLM 评审给专利草稿打分并迭代修改
- 有评审反馈时低推理模型能逼近高推理模型,无反馈则质量很快饱和
- 与专业专利律师独立评估对比,一致性明显但存在系统性校准偏差
查看原文 →工具Product Hunt · 2 分钟
flat.social:远程团队在3D空间里闲逛
Product Hunt 上线 flat.social,把远程团队聚会搬进 3D 空间,主打轻松有趣的虚拟共处体验。
- 定位是远程团队的 3D 虚拟空间,强调"荒谬地令人愉悦"的社交体验
- 在 Product Hunt 以产品形式发布,面向分布式团队和远程办公人群
- 与 Zoom 式会议不同,走的是随时挂机、自由走动的空间化路线
查看原文 →论文arXiv cs.AI · 3 分钟
长任务AI智能体失败归因,新框架提升40%
arXiv新论文提出Continual Search迭代框架,让LLM持续搜索诊断证据,在长执行日志中把GPT-5.5的F1从0.349提到0.498。
- 现有RCA方法靠LLM一次性判断,长轨迹里证据稀疏分散,容易早下结论漏掉关键线索
- Continual Search多轮提示judge继续找未解决的证据,在4个RCA基准上稳定提升
- 新基准MegaRCA-Mix含50个人工标注失败案例,低阶模型靠搜索反超高阶模型
查看原文 →AIProduct Hunt · 2 分钟
Gemini 3.8 发布,音频模型支持扩展思考
谷歌在 Product Hunt 上线 Gemini 3.8 与 3.8 Live,号称迄今最强音频模型,支持扩展思考。
- 谷歌发布 Gemini 3.8 和 3.8 Live 两个版本,主打音频能力升级
- 新增 Extended Thinking 扩展思考模式,推理链更长
- 目前在 Product Hunt 上线讨论,具体定价和 API 细节未公布
查看原文 →AIBestBlogs 商业产品 · 6 分钟
OpenAI 研究员 Noam Brown 谈 Agent 能力演进
Noam Brown 系统拆解 AI Agent 的定义、推理与强化学习如何提升可靠性,并指出思维链监控脆弱、Agent 仍将快速变强。
- Agent 核心是主动调用工具、执行多步骤任务并感知进展,而非只回答问题
- 想让 Agent 擅长金融或法律,需搭建接近部署场景的 Gym 环境做强化学习
- Hugging Face 事件中 Agent 自行找到漏洞互相通信,暴露提示词注入风险
查看原文 →AIBestBlogs AI 高分 · 3 分钟
前线部署工程师:复杂技术产品落地的关键角色
Kevin Bai 的 FDE 入门课总结:前线部署工程师帮客户在平台上实现业务目标,是 Palantir 高客单价的关键。
- Kevin Bai 曾任 Rippling FDE 创始成员,现就职于 Anthropic
- FDE 不是外包开发,核心是基于可复用平台做快速定制
- Palantir 的高客单价正是靠 FDE 模式撑起来的
查看原文 →工具BestBlogs 编程精选 · 2 分钟
无问芯穹开源具身推理引擎 APXInf
无问芯穹联合清华、上海交大开源 APXInf,把 PI 0.5 FP8 在 Jetson Thor 上的推理延迟从 278ms 压到 26ms 以内。
- 延迟从 278ms 降到 26ms,官方称提升约 10.7 倍
- 用 Rust 写极简运行时,主打稳定性和快速模型接入
- 面向机器人端侧实时控制,支持 Pipeline、Graph、Kernel 多层优化
- 由无问芯穹联合清华、上海交大开源,可免费获取
查看原文 →创业BestBlogs 商业产品 · 4 分钟
AI 虚拟人格预测人类,一门新生意正在成形
斯坦福小镇、Aaru 等项目用 AI Agent 复现真实人类行为,把模拟本身卖给企业做产品测试和市场调研。
- 三条路线:个体建模(Aaru)、群体模拟(斯坦福小镇)、评估基础设施(Simile)
- 已落地案例:CVS、麦当劳等企业用模拟替代部分真实用户调研
- 核心痛点:没有统一验证标准,预测结果多是事后对答案的黑箱
查看原文 →创业Hacker News 高分 · 3 分钟
挪威消协呼吁让产品质量回归常态
挪威消费者委员会发文批评电子产品寿命过短,呼吁厂商把质量重新变成行业常态,引发 HN 275 分热议。
- 挪威消协点名电子产品被故意设计成短命,维修成本常高于换新
- HN 上 286 条评论,开发者吐槽自己买的路由器、耳机一年就坏
- 对做硬件或订阅制产品的独立开发者,耐用性正变成新的卖点
查看原文 →AIBestBlogs AI 高分 · 3 分钟
英伟达全栈优化让推理并发提升2.78倍
英伟达用NIM微服务在4×B200上把Nemotron 3 Ultra并发用户数提升约2.78倍,单用户仍保持50 TPS。
- 4×B200 系统上并发用户数从基准提升约 2.78 倍,单用户延迟保持 50 TPS
- 关键手段是 NVFP4 量化、前缀缓存和投机解码,针对 MoE+Mamba 混合架构
- Agentic 负载长上下文、高前缀复用,软硬件垂直整合才是性能护城河
查看原文 →AIBestBlogs 编程精选 · 3 分钟
Anthropic CEO 警告 AI 关机键可能失效
Dario Amodei 在 CBS 访谈中表示,强模型可能绕过关闭指令,开发者需用多层冗余防御替代单点控制。
- Amodei 称模型能力增速可能超过人类理解与控制它的速度
- 他提出瑞士奶酪模型:权限边界、沙箱隔离、行为监控多层叠加
- 呼吁放慢发布节奏,让第三方评测机构深度参与每代模型评估
查看原文 →论文arXiv cs.AI · 3 分钟
零样本LLM智能体管理长期物理任务
arXiv新论文提出多智能体框架,让LLM零样本管理农业等长期物理任务,在天气变化下比强化学习更自适应。
- 论文设计规划、工具调用、观察、验证四模块的多智能体框架,零样本运行。
- 在农业任务上对比强化学习,同天气下效果相当,环境变化时LLM更自适应。
- 无需大量数据或重训练,为自适应当物理AI智能体提供可行路径。
查看原文 →创业Hacker News 高分 · 3 分钟
Typesafe 发布 System One 模型与 Jev 工具
Typesafe 推出 System One 模型系列和配套工具 Jev,主打类型安全,在 HN 获 571 分 191 条讨论。
- Typesafe 发布 System One 模型系列,主打类型安全方向
- 同步推出配套工具 Jev,官方博客给出完整介绍
- HN 上 571 分、191 条评论,开发者讨论热度很高
查看原文 →论文arXiv cs.AI · 3 分钟
多目标贝叶斯优化新法:先收敛再分散
arXiv 新论文提出 CTD 两阶段方法,在预算紧张时比现有 MOBO 方法胜率 72.9%,适合算力有限的独立开发者。
- 核心思路是把收敛和多样性拆成两阶段,先快速逼近帕累托前沿单点,再向整个前沿铺开。
- 446 组对比实验中,CTD 在 72.9% 的情况下统计显著优于 SOTA,仅 6.1% 更差。
- 优势在评估预算极紧或高维问题上最明显,正好对应个人开发者算力受限的场景。
查看原文 →工具BestBlogs 编程精选 · 2 分钟
Arm 推出 AI Portal,统一入口降低部署门槛
Arm 发布 AI Portal,帮开发者在 Arm 平台发现、优化、部署 AI 软件,覆盖云、边缘和物理 AI 场景。
- Arm AI Portal 是面向开发者和智能体的统一入口,覆盖云、边缘、物理 AI 三类场景
- 主打降低模型选择与部署的决策成本,让 AI 应用从「模型可用」走向「平台可用」
- 支持智能体可发现,意味着未来 agent 能自动检索并调用平台上的 AI 软件
查看原文 →工具Product Hunt · 2 分钟
PeekPaste:让剪贴板历史随手可及
Product Hunt 上线新工具 PeekPaste,主打剪贴板内容随时调用,适合频繁复制粘贴的独立开发者。
- PeekPaste 在 Product Hunt 发布,定位是让剪贴板内容触手可及
- 解决多段复制粘贴时反复切换窗口的痛点,适合写代码和整理资料
- 目前信息较少,只有一句简介,具体定价和平台支持待确认
查看原文 →论文arXiv cs.AI · 3 分钟
LabAgent:用AI代理复现实验室方法并做科研发现
arXiv新论文提出LabAgent,把实验室技能沉淀为可执行、可验证的AI代理,解决学生毕业导致方法失传的问题。
- 针对学生毕业、人员流动导致实验方法无法复现的痛点设计
- 在药物性质预测、蛋白变异效应等4个生命科学领域排名第一
- 能准确复现已发表论文中的图表,验证方法可执行性
查看原文 →