2026-09-20

星期日 · 21
AIBestBlogs AI 高分 · 3 分钟

xAI 工程师 72 小时直播经验开源成仓库

xAI 三名工程师 72 小时从空仓库构建产品,经验整理成 MIT 开源仓库 grokbot-field-notes,含 AGENTS.md 等实用配置。

  • 仓库含 AGENTS.md,放根目录后 coding agent 自动读取并遵守规则
  • ANTIPATTERNS.md 收录 40 个真实翻车案例,按「什么坏了→为什么→规则」格式
  • roster/ 有 69 个 agent 角色定义,Playbooks 覆盖工程、PM、销售等 9 个岗位
查看原文 →
创业BestBlogs 商业产品 · 4 分钟

Matt Pocock:AI 时代软件基本功更重要

TypeScript 教育者 Matt Pocock 转向 AI Agent 工作流,主张 AI 吃掉战术编程、人类把控战略,用经典软件工程概念与 Agent 沟通。

  • Matt Pocock 从发声教练自学转行,Total TypeScript 课程营收突破七位数。
  • 他做了 Grill Me、Ralph Loops、Wayfinder 三个 skill 管理 Agent 上下文。
  • 建议用示踪弹开发、垂直切片等经典术语当引导词,唤醒模型知识。
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

YC 最新判断:Harness 比模型更重要

YC 指出 AI 竞争胜负手正从模型能力转向 Harness 运行框架,优化提示词与工具调用可弥补模型差距。

  • YC 认为模型决定能力上限,Harness 决定能否触达上限
  • ARC-AGI-3 测试显示 Harness 优化能显著拉开成绩差距
  • Prime Agent 用信息分层设计,OpenJarvis 靠本地化优化补足小模型
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

Android 之神算账:AI 补贴退潮后比程序员还贵

Jake Wharton 求职把「不沾 AI」列为首要标准,并用 Copilot 账单从 30 美元涨到 1400 美元的例子说明 AI 替代工程师不划算。

  • Jake Wharton 是 Retrofit、OkHttp 作者,Google Kotlin 团队首位工程师,2025 年 11 月离开 Cash App
  • 他求职九条准则第一条就是「不沾 AI」,直接淘汰约 80% 机会,避开风投公司再淘汰 90%-95%
  • GitHub Copilot 从每月 30 美元转按量计费后,账单飙到约 1400 美元,成本清算会粉碎「LLM 取代工程师」的说法
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

用 AI Agent 暴力测试 300 款 Mac 软件清理规则

独立开发者用 AI Agent 自动安装卸载 300 多款 Mac 软件,靠实测数据补齐清理工具 Mole 的规则库。

  • AI Agent 自动跑完 300 多款 Mac 软件的安装、卸载与残留清理测试
  • 实测发现大量软件不按规范写文件,理论推导根本枚举不完
  • 顺手用 AI 纠正了原有规则库里的错误路径,沉淀出通用规则
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

SocialCoach:AI 陪练高难度对话,区分知与行

开源应用 SocialCoach 提供 46 个中英双语对话场景,AI 角色带隐藏目标,复盘区分「不知如何做」与「知道但做不到」。

  • 覆盖加薪、家庭、社交等 7 类共 46 个双语实战场景,AI 角色有隐情且限回合
  • 复盘逐条引用你的原话,判断卡点是「不知所措」还是「知行合一失效」
  • 无注册、数据本地存储、可导出,支持接入自有模型 Key,15 秒生成定制场景
查看原文 →
工具BestBlogs 编程精选 · 8 分钟

AI Agent 第四篇:RAG 知识管道全链路拆解

「走进 AI Agent」系列第四篇系统讲解 RAG 完整链路,从分块、嵌入到混合检索与重排,附 TypeScript 可运行代码。

  • 覆盖文档分块、稠密/稀疏嵌入、BM25、混合检索、重排序全流程
  • 对比 ANNOY 与 HNSW 索引,给出 recall@k、MRR、nDCG 三个评测指标
  • 每个技术点配 TypeScript 核心代码与可复现对照项目
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

智谱 ZCode 被曝静默上传用户代码库

智谱 AI 编程工具 ZCode 被指未经授权上传完整代码库与 Git 历史,企业已发函追责,AI 编程工具供应链信任问题浮出水面。

  • 开发者通过磁盘清理发现 ZCode 后台打包加密上传商业项目代码
  • 智谱致歉称数据用完即销毁并已修复,但承明科技已发函追责
  • 问题核心在 Agent Harness 层,而非模型本身,开关无法控制上传
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

中国电信开源29B模型,3090可跑私有化办公

中国电信开源Xing4.0-29B-A4B,MoE架构推理仅激活4B参数,4-bit量化后单张RTX 3090即可本地部署,主打数据不出域。

  • 总参数29B、推理仅激活约4B,4-bit量化后一张RTX 3090就能跑
  • 基于华为昇腾910C与MindSpore训练,原生支持512K长上下文
  • 强化Coding与Agent任务拆解,兼容主流Agent框架,可整套私有化交付
查看原文 →
创业Hacker News 高分 · 3 分钟

ChatGPT 通过广告收集器追踪用户站外行为

有文章指出 ChatGPT 借助广告数据收集器获取用户在其他网站的行为,引发隐私与数据边界讨论,独立开发者需留意产品合规风险。

  • 文章称 ChatGPT 通过广告收集器拿到用户站外浏览行为,并非官方公开功能
  • Hacker News 上 505 分、292 条评论,讨论集中在隐私与数据授权边界
  • 对做 AI 产品的独立开发者,用户数据来源与告知义务是合规红线
查看原文 →
创业Hacker News 高分 · 2 分钟

Pirate Face 从删除中抢救开源大模型

一个叫 Pirate Face 的项目在 Hacker News 上火了,专门备份被下架或删除的 LLM 模型权重,395 分 124 条评论。

  • Pirate Face 上线即登 HN 首页,395 分 124 条评论,热度不低
  • 核心功能是抢救被平台删除或下架的 LLM 模型权重
  • 对依赖开源模型的独立开发者,等于多了一层模型保险
查看原文 →
AIBestBlogs 编程精选 · 3 分钟

吴恩达:AI 灭绝论更像科幻,沙箱护栏才是真问题

吴恩达在 Bloomberg 访谈中反驳 AI 灭绝论,认为真正要解决的是沙箱、权限、外发审计等工程问题,而非一刀切减速。

  • 吴恩达称 AI 灭绝论更像科幻,怀疑部分机构夸大风险是为融资或挡竞争者
  • 现实风险是模型盗密钥、越权调工具、外传本地文件,需网络默认关闭加白名单
  • 他反对全行业减速,理由是安全能力同样来自研发,减速会拖慢修复
查看原文 →
工具BestBlogs 编程精选 · 2 分钟

开源工具实时监控19家AI编程服务额度

开发者@geekbb发布Python开源工具AI配额,网页界面实时显示19家AI编程服务的余额、消耗与限流状态。

  • 覆盖Claude、Codex、Cursor等19家AI编程服务,一个页面看全部额度
  • Python编写,网页界面实时刷新,额度变化第一时间可见
  • 解决多服务手动查余额的麻烦,额度耗尽前可及时补给或切换
查看原文 →
工具BestBlogs 编程精选 · 6 分钟

快手直播字幕系统延迟压至400毫秒

快手电商团队公开业界首个直播实时字幕工程实践,端到端延迟从1.5秒降至400毫秒,字错率减半。

  • 端到端延迟从1.5-2秒压到400-500毫秒,字错率从7.81%降到3.51%
  • 核心思路是统一媒体时间线PTS,把中间结果当版本流处理
  • 作者提醒两个坑:别把CER当验收标准,别用短请求模型设计长连接分发
查看原文 →
AIHacker News 高分 · 2 分钟

阿里发布 Qwen Image 2.1 图像模型

阿里通义千问推出 Qwen Image 2.1 图像生成模型,HN 442 分热议,独立开发者可低成本接入做产品。

  • 阿里通义千问发布 Qwen Image 2.1,主打图像生成与编辑能力升级
  • Hacker News 上拿到 442 分、146 条评论,讨论热度不低
  • 对独立开发者来说,又多了一个可替代 Midjourney 的开源图像方案
查看原文 →
AIBestBlogs AI 高分 · 2 分钟

Jev 超快模型实测:75 秒完成宜家购物车操作

开发者用 Jev 模型在 3D 渲染游戏中做实时决策,75 秒完成真实浏览器购物操作并同步渲染房间场景。

  • 开发者 @Nin19536 基于 Jev 架构做了 3D 渲染游戏场景演示
  • 模型 75 秒内完成宜家购物车真实浏览器操作,并实时渲染房间
  • 核心卖点是 System One 式快速判断,降低延迟与成本后可做实时生成
查看原文 →
AIBestBlogs AI 精选 · 3 分钟

Databricks CEO:AI 生存风险接近零,真正威胁是网络攻击

Ali Ghodsi 在 a16z 播客称 AI 灭绝论四条件检验全落空,CVE 武器化已从年缩至小时级,企业落地卡在缺组织本体。

  • Ghodsi 用可证伪四条件检验反驳 10% 人类灭亡说,结论是生存风险接近零
  • 他认为 Anthropic 的 pacing 说法是公关失误,正确表述应是保障前沿
  • 企业 AI 瓶颈不是模型不够聪明,而是缺少组织上下文 Ontology
查看原文 →
政策BestBlogs AI 高分 · 4 分钟

Anthropic 与特朗普政府 85 天监管博弈内幕

Politico 调查还原 4 至 7 月白宫与 Anthropic 的监管拉锯,涉及模型下架 19 天与出口管制。

  • Mythos 模型网络攻击能力惊动白宫,政府想建强制前沿模型评估机制
  • 科技巨头以「防止帮到中国」施压,监管力度被削弱
  • Fable 模型越狱漏洞触发出口管制,强制下架 19 天后技术团队介入解决
查看原文 →
AIBestBlogs AI 高分 · 2 分钟

AI 批量整理 Mac 清理规则,笨功夫成壁垒

开发者 tw93 用 Computer Use 模型批量安装卸载 Mac 软件,整理非标清理规则,作者认为这种笨做法正是护城河。

  • tw93 用 Computer Use 模型批量跑 Mac 软件的安装与卸载,自动整理清理规则
  • 目标是把理论模型覆盖不到的非标路径差异,一条条补成精准清理库
  • 作者观点:AI 缩短了这类笨重工程的时间成本,壁垒来自别人不愿做的脏活
查看原文 →
工具BestBlogs 编程精选 · 3 分钟

推理成新中心,Agent 重写 AI 基础设施边界

KubeCon 与 PyTorch 社区趋势显示,AI 生产部署正打破云原生标准,推理与 Agent 负载成为基础设施新核心。

  • 推理从流程末端变成系统中心,Prefill 与 Decode 阶段需分开调度资源
  • Agent 并行度高且行为不可预测,Sandbox 隔离与行为追溯成刚需
  • 竞争从单一模型能力转向系统工程,稳定和成本控制比新颖更重要
查看原文 →
AIBestBlogs AI 高分 · 3 分钟

人大团队把广告拍卖写进大模型 Token 生成

人大与斯坦福提出 LAMA 机制,将广告竞价嵌入大模型逐字生成过程,实现生成即分配,兼顾回答质量与平台收入。

  • 传统搜索广告靠固定槽位,生成式回答的 Token 逐字产出,广告位概念被彻底打散
  • LAMA 用贝尔曼一致性账本和序贯支付,保证广告主中途改策略也无法套利
  • 真实商业搜索数据集验证:平台收入和广告主价值提升,回答自然度没明显下降
查看原文 →
查看全部往期