AIBestBlogs AI 精选 · 3 分钟
DeepSeek V4.1 Flash 发布:552B MoE 开源降价
DeepSeek 发布原生多模态 V4.1 Flash,552B MoE 架构,KV Cache 降至 1/4,API 降价并开源权重。
- 552B MoE 非对称结构,输入激活 8B、输出激活 16B,Benchmark 超过 V4 Pro
- KV Cache 对 HBM 和 SSD 需求分别降到上一代 1/4 和 1/8,推理成本大降
- API 全面替代上代 Flash,推峰谷优惠定价,权重和论文已上 Hugging Face
查看原文 →创业BestBlogs 商业产品 · 3 分钟
Stripe 用不到 10 人团队服务万名员工 AI
Stripe 内部 Agent Kai 覆盖 1 万员工、采用率 86%,核心不是工具而是 Project 治理与 skill 复用。
- Kai 每周超 1 万名 Stripe 员工使用,采用率 86%,核心团队不到 10 人
- 治理靠 Project 划定模型、数据权限与人工审批边界,员工在边界内自由用
- 约 2000 个 skill 把一次性对话变成可复用工作流,用遥测决定推广或归档
查看原文 →AIBestBlogs 商业产品 · 3 分钟
DeepSeek 发布 V4.1 Flash,性能反超 Pro 并下线
DeepSeek 上线 V4.1 Flash,552B MoE 模型仅激活 8B/16B,Agent 测试反超 V4 Pro,官方将逐步下线 Pro。
- V4.1 Flash 总参数 552B,输入激活约 8B、输出约 16B,推理成本大幅降低
- FP4 KV Cache 让 HBM 需求降至 1/4,相比初代 KV Cache 缩小约 437 倍
- 同步发布 Harness v0.1.5,支持插件生态与多 Agent 协作,转向 Agent 工作环境
查看原文 →AIOpenAI Blog · 2 分钟
OpenAI 发布 Agents API 托管云代理
OpenAI 推出 Agents API,基于 Codex harness 提供托管服务,支持长时运行会话与工具调用,个人开发者可直接构建云代理。
- OpenAI 发布 Agents API,由 Codex harness 驱动,负责编排与工具调用
- 主打长时运行会话,代理可在云端持续执行任务,无需自建调度
- 托管服务形态,个人开发者不用维护基础设施即可上线代理
查看原文 →AIOpenAI Blog · 2 分钟
OpenAI 发布 GPT-Live-1 语音 API
OpenAI 在 API 中上线 GPT-Live-1,支持全双工自然语音对话、自定义音色和电话接入,开发者可直接调用。
- GPT-Live-1 支持全双工对话,能边听边说,不再是一问一答式轮次
- 新增自定义音色和电话(telephony)支持,可接打电话场景
- 指令遵循能力增强,通过 API 直接调用,无需自建语音管线
查看原文 →工具BestBlogs 编程精选 · 4 分钟
Agentic Harness:把 AI 编码变成流水线
作者开源自研框架,用十二阶段生命周期和 Sub-Agent 协作,把 AI 编码从碰运气变成可复现流程。
- 框架含 12 阶段生命周期,从初始化到归档全程状态落盘
- 主会话 Manager 只做调度,具体任务交给阶段级 Sub-Agent
- 作者坦承仍有上下文重加载、原子写入等 8 个未解痛点
查看原文 →工具BestBlogs 编程精选 · 2 分钟
MSSH:5MB 单文件 SSH 客户端,配置本地优先
MSSH 是一款 Windows/macOS 轻量 SSH 客户端,配置默认存本地,可选一台设备做服务端同步多机主机列表。
- 单文件绿色版,解压即用,支持 Windows 和 macOS,无需注册或强制联网
- 内置多会话终端、SFTP 和类 Xshell 快捷键,v0.4.0 公测中
- 把 NAS 或云主机设为资料库服务端,用 IP 加 Token 同步主机配置
查看原文 →创业Hacker News 高分 · 3 分钟
微软将 Rust 列为一等语言,570 分热议
微软官方确认 Rust 升为一级语言,Windows 与 Azure 核心组件已用其重写,独立开发者技术选型可参考。
- 微软把 Rust 与 C++、C# 并列为一级语言,内部培训与工具链全面支持
- Windows 内核和 Azure 云服务已有 Rust 重写模块,内存安全漏洞显著下降
- HN 上 570 分、310 条评论,讨论集中在学习曲线与招人难度
查看原文 →工具BestBlogs 编程精选 · 6 分钟
美团发布 Agent 评测白皮书首篇
美团技术团队提出四模块三能力两 Loop 框架,系统梳理 Agent 评测体系,并附成熟度自查表。
- 框架含离线评测、在线监控、Case 挖掘归因、观测基建 4 个模块
- 两条 Loop 指 Agent 迭代与评测体系迭代,共享线上真实样本
- 评测集分黄金集、错题集、挑战集,以商家经营分析 Agent 为例
查看原文 →创业Hacker News 高分 · 3 分钟
Shopify 从 React Native 回归原生开发
Shopify 工程团队宣布放弃 React Native 转回原生开发,640 分 433 评论引发独立开发者对技术选型的讨论。
- Shopify 工程博客发文,宣布移动端从 React Native 迁回原生,理由是性能与体验
- HN 上 640 分、433 条评论,讨论集中在跨平台框架的长期维护成本
- 对独立开发者来说,选型前先想清楚:省下的开发时间是否抵得上后期重构代价
查看原文 →论文arXiv cs.AI · 3 分钟
状态路径工具菜单让智能体成功率提升16%
研究者提出状态路径工具菜单,在ToolBench上把在线成功率从0.737提到0.898,不改动智能体本身。
- 核心思路:菜单是执行先验,按状态路径排序工具,让生产者排在消费者前面
- ToolBench成功率从0.737升到0.898,超过检索、重排、生成、路由四类基线
- 32个工具的状态路径菜单,覆盖链条比官方128个工具列表还完整
查看原文 →AIBestBlogs AI 高分 · 2 分钟
GPT Image 生成 UI 稿可直接 1:1 还原
开发者实测用 Codex 优化描述后,GPT Image 产出的 UI 效果图细节足够,能直接 1:1 还原成设计稿。
- 作者在做 GPT 代充网站,用测试用户反馈的真实问题做输入
- 先用 Codex 把模糊问题改写成结构化提示词,再喂给 GPT Image
- 生成的效果图细节够高,可跳过手绘直接 1:1 还原
查看原文 →AIOpenAI Blog · 2 分钟
ChatGPT 推出数据智能体,自然语言做看板
OpenAI 在 ChatGPT Work 中上线 Data agent,可连接公司数据源,用自然语言生成洞察和交互式仪表盘。
- 入口在 ChatGPT Work,面向企业版用户,不是普通聊天窗口
- 支持接入公司自有数据源,直接问数、出图、搭交互看板
- 全程自然语言,不用写 SQL,数据分析门槛被进一步拉低
查看原文 →AIHugging Face Blog · 3 分钟
用 Gradio Workflow 重写 AUTOMATIC1111 界面
Hugging Face 官方博客演示如何用 Gradio Workflow 重建 Stable Diffusion WebUI 的交互流程,给独立开发者一个可复用的前端搭建思路。
- AUTOMATIC1111 是 Stable Diffusion 最流行的 WebUI,这次被拿来当 Gradio Workflow 的实战案例
- 核心是把文生图、参数面板、队列等模块拆成可组合的 workflow 节点
- 对想自建 AI 工具界面的 solo founder 来说,这是一份可直接抄的架构参考
查看原文 →AIHacker News 高分 · 3 分钟
Cognition 发布 SWE-2 编程模型,对标 Fable 5.1
Cognition 推出新一代编程模型 SWE-2,号称在代码任务上对标 Fable 5.1 与 GPT-Astra,HN 上 331 分 135 评论。
- Cognition 发布 SWE-2,官方称在真实代码任务上对标 Fable 5.1 和 GPT-Astra
- HN 讨论热度 331 分、135 条评论,开发者关注度不低
- 对独立开发者来说,又多了一个可接入的编程 Agent 模型选项
查看原文 →AIBestBlogs AI 高分 · 3 分钟
浙大港大开源 LayerRecall,1.65M 参数提升长视频记忆
浙大杨易团队与港大开源轻量记忆路由模块,仅训练 1.65M 参数即可让长视频生成记住远期角色与场景,骨干模型保持冻结。
- 只训练 1.65M 参数,约为 5B 生成骨干的 0.033%,骨干完全冻结
- 只把记忆注入预分析出的敏感层,其余层保留滑动窗口,避免画面突变
- 端到端生成时间仅增加约 3.5 秒,可零再训练迁移到 LongLive、Self-Forcing
查看原文 →AIBestBlogs AI 精选 · 4 分钟
DeepSeek-V4.1-Flash 技术报告解读:长程 Agent 如何重分配预算
DeepSeek 新报告用 CED、CSA2、FP4 量化把长上下文 KV 缓存开销压下来,让长程 Agent 跑得更省更稳。
- CED 架构 + CSA2 稀疏注意力,把上下文扩到 1M token,KV 缓存跨层共享、低精度存储。
- 45T 多模态 tokens 预训练,SFT→RL→OPD 三阶段训练,配 Engram 记忆与 DSpark 草稿机制。
- 在 DeepSWE v1.1、Terminal-Bench 3.0、GPQA Diamond 上成绩亮眼,长程任务成本明显下降。
查看原文 →AIBestBlogs 编程精选 · 6 分钟
Agent 自进化全景:从 Skill 到模型权重
一篇系统梳理 AI Agent 自进化技术图谱的文章,盘点 9 种 Skill 与参数进化方法,帮开发者理解如何让 Agent 越用越强。
- 文章拆解 Trace2Skill、EvoSkill、SkillOpt 等 6 种 Skill 进化方法,核心是执行到反馈的闭环
- 参数层覆盖 Harness 进化、HyperAgents 元进化、自蒸馏等 4 条路径,含 GiGPO 算法细节
- 作者指出落地两大坑:进化方向不可控、质量不稳定,需配套数据反馈与评估体系
查看原文 →AIBestBlogs 编程精选 · 4 分钟
Graph Engineering 爆火,是真趋势还是造词
多智能体协作新范式 Graph Engineering 48 小时获数百万浏览,文章拆解其与知识图谱的区别及落地路线。
- 文章提出 AI 工程五层栈:Prompt→Context→Harness→Loop→Graph,逐层扩大关注范围
- 核心是双图架构:Org Graph 管稳定角色,Work Graph 管动态任务,实现并行与失败隔离
- 落地建议先跑单 Agent Loop,再拆角色,最后上双图,角色边界维护是最大瓶颈
查看原文 →AIBestBlogs AI 高分 · 3 分钟
DeepSeek-V4.1-Flash 架构曝光:上下文重整化
DeepSeek 新架构把 Context 从 Token 序列变成可重整化的计算状态,靠 6 个模块压缩超长上下文。
- 核心是 CED 因果编解码器,沿深度对 Context 做粗粒化重整化
- Engram 静态记忆 + CSA2 跨层复用,固化并复用稳定关系
- Indexer 筛选 + Bounded Replay + FP4 压缩,管理历史状态与存储
查看原文 →工具BestBlogs 编程精选 · 2 分钟
Konode:开源跨浏览器同步工具,数据存自己手里
Konode 是款开源浏览器扩展,能在 Chromium 和 Firefox 之间同步书签、历史和标签页,数据存 WebDAV 或 GitHub,不经过第三方云。
- 支持 Chromium 系与 Firefox 跨内核同步书签、历史、标签页和扩展
- 不提供云端,用户自配 WebDAV、Nextcloud 或 GitHub 存储,同步前可加密
- 目前 Firefox 版有已知 Bug,需自行编译源码解决,适合进阶用户
查看原文 →工具BestBlogs 编程精选 · 2 分钟
AIPOCH 发布本地化科研工作台,产出可追溯
AIPOCH Open-Science 集成 22 个科研 Skill 与 24 个数据连接器,数据本地存储,所有产出物可追溯至生成代码与环境。
- 内置 22 个科研 Skill、24 个数据连接器,支持按 DOI 导入文献
- 自然语言下目标,Agent 自动读文件、跑 Python/R 并生成报告
- 图表版本锁定不可改,可回溯到当时的代码和运行环境
查看原文 →AIOpenAI Blog · 2 分钟
研究员用 Codex 从灭绝基因组中找抗生素
宾大实验室用 Codex 与 ChatGPT 挖掘现存及灭绝物种基因组,寻找抗耐药菌的抗菌分子,把 AI 变成科研流水线。
- César de la Fuente 实验室用 Codex 扫描现存与已灭绝物种基因组,筛抗菌肽候选
- 目标是耐药感染,传统湿实验筛选慢,AI 先做序列级初筛再验证
- 对独立开发者启示:Codex 可当科研自动化脚本引擎,不只写业务代码
查看原文 →创业Hacker News 高分 · 2 分钟
NASA火星配色技术,如今用来发现地球岩画
NASA为火星探测开发的色彩增强算法被用于考古,让肉眼难辨的古代岩画重新显现,一人公司也能用类似图像处理思路做产品。
- 这套算法原本用于火星车图像,通过拉伸色彩通道让岩石纹理更清晰
- 考古团队把它搬到地球,成功识别出多处肉眼看不见的古代岩画
- 核心是开源图像处理思路,独立开发者可借鉴做垂直工具
查看原文 →创业Hacker News 高分 · 3 分钟
别让人拿走你那箱线缆:数字时代的自持哲学
Jim Nielsen 在 HN 发文,以实体线缆箱比喻个人对数字资产与工具的控制权,引发 198 条讨论。
- 作者用一箱旧线缆比喻:留着看似无用的东西,是对抗被平台绑架的底气
- HN 上 242 分、198 条评论,讨论集中在自托管、数据导出与工具锁定
- 对独立开发者意味着:选工具时优先考虑可迁移性,别把命脉交给单一平台
查看原文 →创业Hacker News 高分 · 3 分钟
数学家质疑:未发表论文该不该交给 OpenAI
数学社区热议研究者能否信任 OpenAI 处理未发表成果,555 条评论刷屏 HN,涉及数据保密与署名风险。
- 争议起于数学圈对 OpenAI 接触未发表论文的信任问题,原帖在 Mathstodon 发酵
- HN 讨论量达 555 分 555 评论,是当天热度最高的学术伦理话题之一
- 对独立研究者来说,把核心 idea 交给大模型前先想清楚保密和优先权
查看原文 →AIOpenAI Blog · 2 分钟
OpenAI 推出金融服务版 ChatGPT 内置金融数据
OpenAI 发布面向金融行业的 ChatGPT,内置金融数据并搭载 GPT-6 Astra,可做研究、建模和客户材料。
- 内置金融数据源,不用自己接行情和财报 API
- 底层换成 GPT-6 Astra,官方称可做建模和客户级材料
- 目前定位金融机构,个人开发者能否用还没说清
查看原文 →政策Hacker News 高分 · 3 分钟
索尼被扒出官网自相矛盾的数字游戏所有权表述
消费者权利维基整理索尼官网多处称玩家"拥有"数字游戏的表述,与其诉讼中"仅授权"立场冲突,339 分热帖。
- 索尼在 PlayStation 官网多处用 own/purchase 描述数字游戏,诉讼中却称只是授权
- 该维基页面汇总了这些自相矛盾的官方表述,作为集体诉讼证据
- HN 上 339 分、112 条评论,数字所有权话题再次引爆讨论
查看原文 →论文arXiv cs.AI · 3 分钟
新基准用过程轨迹评估AI科学家工作流
arXiv 发布 OpenDiscoveryTrace,含 558 条 AI 科研智能体完整轨迹,揭示只看结果会漏掉的行为差异。
- 数据集含 558 条轨迹,覆盖 124 个科研任务,横跨药物发现、材料、基因组等 4 个领域
- 每条轨迹按 9 字段记录思考、工具调用、错误、修正触发和自评置信度
- 前沿模型成功率都在 84-89%,但 Claude Opus 4.6 每轨迹错误数是 GPT-5.4 的 30 倍
- 数据、轨迹 schema、agent harness 和基准定义以 CC BY 4.0 公开
查看原文 →论文arXiv cs.AI · 3 分钟
论文对比子代理与技能包执行长任务
arXiv 新论文研究长周期任务中,把可复用技能包作为子代理执行,比直接塞进主上下文更稳,但通信开销更大。
- 技能包是多文件包,含指令、脚本和资源,供 agent 复用
- 子代理执行会开新上下文窗口,避免主上下文越堆越乱
- 前提是技能包要有清晰输入输出契约,否则收益不明显
查看原文 →工具Product Hunt · 2 分钟
Modeinspect:在代码库里直接设计产品 UI
Product Hunt 上线 Modeinspect,主打在代码库中直接设计产品 UI,并提供 99 天免费 AI 额度。
- Modeinspect 在 Product Hunt 发布 1.0,定位是直接在代码库里设计产品 UI
- 官方给出 99 天免费 AI 额度,适合先白嫖再决定是否付费
- 对独立开发者来说,省掉设计稿到代码的来回切换环节
查看原文 →论文arXiv cs.AI · 3 分钟
北极生态导航多智能体GeoAI系统发布
研究者推出人机协同多智能体GeoAI系统,为北极航线规划同时权衡安全、生态与社区影响,代码已开源。
- 系统用多个专用智能体分工:地理数据采集、多目标路线生成、天际线决策支持。
- 生态标准明确纳入必需鱼类栖息地和海豹关键栖息地等敏感区域暴露度。
- 项目页面和GitHub代码已公开,可复现并用于其他多准则路径规划场景。
查看原文 →论文arXiv cs.AI · 3 分钟
主动学习加速稀土回收工艺放大实验
PNNL用主动学习把稀土回收实验从48次降到16次,为小团队做材料研发提供省实验成本的新思路
- PNNL的CICERO工作流用主动学习选实验,16到24次就找到最优富集结果,传统方法要48次
- 在回收钕铁硼磁体数据上验证,两阶段重建策略与自适应方案打平,都是16次
- 作者提出按下游贝叶斯风险降幅选批次,并规划了预注册的前瞻性测试
查看原文 →AIBestBlogs AI 高分 · 3 分钟
王坚外滩大会喊话年轻人:做非理所当然的AI
阿里云创始人王坚在2026外滩大会演讲,呼吁年轻人以非理性方式思考AI,让技术减少资源消耗而非只完成更多任务。
- 王坚提出"城市大脑之问":用10%资源也能过好生活,AI应是省资源的工具
- 他举 reusable 火箭、小型喷气自行车等青年案例,称热爱是发动机的燃料
- 他认为AI能耗问题可解,AI不会取代人,而是重新定义人的能力边界
查看原文 →AIBestBlogs AI 高分 · 6 分钟
MemPO 源码解析:让智能体自主管理长程记忆
MemPO 用双通路奖励端到端训练智能体自主压缩记忆,基于 VeRL 实现,适合研究 Agent 记忆机制的开发者。
- 每轮交互开头模型自主生成记忆摘要,无需外部记忆模块
- 双通路奖励:全局结果奖励 + 局部记忆信息量奖励
- 代码基于 VeRL 框架,含异步多轮 Agent Loop 环境设计
查看原文 →论文arXiv cs.AI · 3 分钟
免训练框架把单张图变成可探索3D游戏地图
arXiv新论文提出Valerant,用预训练动作条件世界模型加SLAM,免训练把单张图片逐步重建为可导航的持久3D游戏地图。
- 核心思路:预测性视觉rollout + SLAM空间重建 + 探索驱动动作选择,三件套拼成WAM
- 最大卖点是training-free,直接拿预训练动作条件世界模型改造,不用重训
- 目标是减少3D游戏地图手工制作成本,目前仍是论文阶段,没有开源代码和demo链接
查看原文 →