工具BestBlogs 编程精选 · 3 分钟
DeepSeek V4 Flash 发布,性能暴涨价格低至地板
DeepSeek V4 Flash 正式版性能大幅提升,价格保持低位,缓存机制大幅降低重复输入成本,对独立开发者极具性价比。
- Terminal-Bench 2.1 提升 34%,DeepSWE 提升 600%,性能接近一线模型
- 输入价格比 Fable 5 低 98.6%,输出低 99.4%,性价比碾压
- 98% 重复输入折扣,适合高频调用场景,可大幅降低 API 成本
查看原文 →AIBestBlogs AI 高分 · 3 分钟
吴恩达开源AI代理OpenWorker,本地运行引热议
吴恩达与Rohit Prasad开源本地AI代理OpenWorker,四层架构支持多模型,权限控制精细,适合重视隐私的开发者。
- 四层架构:Tauri+React前端,Python后端,集成25+工具
- 四级风险权限,五种模式,本地运行保护数据隐私
- 支持Mac/Windows,用aisuite路由多模型,可定制开发
查看原文 →AIBestBlogs AI 高分 · 4分钟
Jeff Dean谈AI下一步:Agent闭环与创业机会
Jeff Dean在YC访谈中预测AI竞争转向智能组织能力,强调长程Agent闭环系统与上下文工程,并指出创业应聚焦通用模型成功率低的领域。
- AI竞争从模型规模转向智能组织能力,长程Agent需闭环系统
- 创业机会在通用模型成功率近0%领域,用专有数据差异化
- 分享MapReduce、TPU等案例,强调量化瓶颈与通用抽象
查看原文 →AIBestBlogs AI 高分 · 3 分钟
Karpathy 用 Opus 5 生成指环王 3D,暴露 LLM 无法实时审视作品
Karpathy 用 Opus 5 以 100 万 Token 生成《指环王》3D 渲染,耗时 2 小时写 5500 行代码,但指出 LLM 无法直接观看视频,难以自查。
- Karpathy 给 Opus 5 100 万 Token 预算,生成《指环王》3D 渲染
- 模型花 2 小时写 5500 行 JS 代码,产出可玩 3D 世界
- 局限:LLM 无法原生看视频,只能逐帧截图,易出错难审计
查看原文 →工具BestBlogs 编程精选 · 3 分钟
多模型并行 Debug 工作流:不恋战、用 /handoff 交接
作者分享高效 AI 编程 debug 流程:模型多次失败即用 /handoff 交接,可并行多模型修 bug,最后主模型 reconcile,减少上下文污染。
- 同一模型几轮搞不定就换,避免上下文污染
- 用 /handoff 生成交接文档,新开 session 切换模型
- 高难度 bug 可开多个 worktree 并行修,主模型 reconcile
查看原文 →工具BestBlogs 编程精选 · 3 分钟
五步让 Coding Agent 记住项目工作方式
文章提出 AGENTS.md、知识路由、Skill、CLI/MCP/Hook 与工作循环五步,让 AI 编码代理持续改进,减少重复指导。
- 根目录写 AGENTS.md,提供入口、启动命令和风险提示
- 核心文档按条件接入任务路径,形成知识路由
- 重复任务提炼为 Skill,定义触发条件和验证方式
- Skill 转为 CLI/MCP 接口,配合 Hook/CI 自动检查
- 任务后回顾,稳定事实写回 AGENTS.md,形成工作循环
查看原文 →AIBestBlogs AI 高分 · 3 分钟
Karpathy 用 Opus 5 将《指环王》变 3D 动画,暴露 LLM 视觉短板
Karpathy 用 Opus 5 将《指环王》文字转成 3D 动画,耗 100 万 token,暴露 LLM 多模态感知缺陷,对开发者选型有参考。
- 实验耗 100 万 token($10),生成 5500 行 Three.js 代码
- 对比 DeepSeek v4 flash 和 Kimi K3 max,视觉能力差距明显
- 附 Paul Graham 散文电子书案例,展示文本处理优势
查看原文 →工具BestBlogs 编程精选 · 3 分钟
MCP 协议大改:移除会话握手,转向无状态 HTTP
MCP 协议迎来重大更新,废除会话和握手机制,改用无状态 HTTP,简化服务器部署,但引发开发者争议,需注意迁移。
- 移除初始化握手和会话粘滞,服务器可轮询调度水平扩展
- 状态管理转移至应用层,弃用过渡期至少 12 个月
- 开发者反馈两极分化,不兼容变更需十周验证期
查看原文 →AIBestBlogs AI 高分 · 3 分钟
英伟达斯坦福联合发布RoboTTT,机器人上下文扩至8K
英伟达与斯坦福联合推出RoboTTT技术,将机器人视觉-动作上下文扩展至8K时间步,显著提升长时序任务完成率,对机器人自动化领域有重要影响。
- RoboTTT采用Fast Weights机制,上下文长度达8K时间步
- 三项装配任务平均完成分数79%,基线最高56%
- 支持One-shot模仿和错误恢复,但依赖训练数据
查看原文 →AIBestBlogs AI 高分 · 3 分钟
35M 参数小模型 BarunLM 单卡训练,零样本超越大模型
独立开发者用单张 H200 训练出 35M 参数模型 BarunLM-35M,零样本评测平均 41.01%,超越更大模型,适合本地开发。
- 仅 35M 参数,单张 H200 GPU 完成训练
- 零样本评测平均 41.01%,超越 LFM2.5-230M 和 GPT-2
- 混合注意力机制,面向教学和本地开发,未做指令微调
查看原文 →工具BestBlogs 编程精选 · 3分钟
微软Meta财报对比:AI投资回报分化明显
微软与Meta同日发布财报,微软Azure增长41%证明AI商业化,Meta现金流骤降91%至7.84亿美元,AI投资回报存疑。
- 微软Azure收入破1000亿美元,增长41%,Copilot付费席位超3000万
- Meta Q2收入608亿美元,但成本激增55%,利润降14%
- Meta自由现金流仅7.84亿美元,同比降91%,AI烧钱压力大
查看原文 →工具BestBlogs 编程精选 · 3 分钟
GitHub AI Agent 现提示注入漏洞,一句话可窃取私有数据
Noma Security 发现 GitHub Agentic Workflow 存在提示注入漏洞,攻击者只需在公开 Issue 中嵌入指令,即可诱导 AI 泄露私有仓库数据,无需任何黑客技术。
- 漏洞代号 GitLost,由 Noma Security 发现,攻击者无需技术即可利用
- 在公开 Issue 中植入特定提示词,可绕过防护窃取私有仓库数据
- 建议限制 Agent 权限、清理用户输入,完整报告见 Noma 官网
查看原文 →AIBestBlogs AI 高分 · 5分钟
四种Agent开发方法对比:BMAD、Spec Kit、GSD与Skills选型指南
文章对比BMAD、Spec Kit、GSD Core和Matt Pocock Skills四种Agent开发方法,从控制层级、流程规范等维度给出选型建议,强调按需选择而非追热度。
- BMAD:多角色敏捷框架,适合复杂产品与团队协作
- Spec Kit:以规格说明为核心,构建治理资产
- GSD Core:专注上下文工程与长任务管理
查看原文 →工具BestBlogs 编程精选 · 4 分钟
Jotai v2.20 重构存储模块,高吞吐性能显著提升
Jotai v2.20 通过重构内部存储构建模块,避免 WeakMap 性能瓶颈,提升高吞吐场景性能,为 v3 铺路。
- 核心贡献者 David Maskasky 主导重构,移除 getInternalBuildingBlock 函数
- 为 onMount hooks 引入 Rev3 类型收窄,并延迟新 atom state 的 hooks
- v3 计划移除 CommonJS 支持,停止支持 React 18 以下版本
查看原文 →工具Product Hunt · 2分钟
Termexo:本地Windows工作台,让Claude Code与Codex更顺手
Termexo是一款本地Windows工具,为Claude Code和Codex提供统一工作台,简化AI编码流程,适合独立开发者提升效率。
- 专为Windows设计,本地运行,数据更安全
- 集成Claude Code和Codex,统一操作界面
- 适合solo开发者,减少切换成本,提升编码效率
查看原文 →创业BestBlogs AI 高分 · 3 分钟
VC 合伙人谈 AI 投资:稀缺的是智慧而非智能
BAI 资本合伙人汪天凡分享 15 年投资心得,认为 AI 时代应投资能注入人性光辉、帮助用户活在当下的产品,而非纯效率工具。
- 汪天凡提出“三非理论”:非共识、非连续、非线性,指导投资决策
- 他反向押注 Pendant 形态硬件,而非热门的 AI 眼镜
- 强调创始人初心比技术更重要,起点决定终点
查看原文 →创业Hacker News 高分 · 2 分钟
Karpathy发布Pelican项目,独立开发者新工具引热议
Karpathy在推特发布新项目Pelican,引发HN社区310分、245条评论的热烈讨论,对独立开发者可能意味着新的AI工具或工作流。
- Karpathy推特发布Pelican,HN热度310分,245条评论
- 项目细节未披露,但Karpathy背景暗示AI相关工具
- 独立开发者可关注其后续开源或商业化可能
查看原文 →