AI Builders Digest 0915:放缓提议遭遇动机质疑,Claude Mods 落地,OpenAI 莉莉计划曝光
- Anthropic 与 OpenAI 被曝寻求反垄断豁免以协调放缓前沿开发,Cohere CEO 等批评者质疑其真实动机
- Matt Turck 以囚徒困境判断 AI 进展不会放慢:玩家与经济激励太多,任何一方都有抢跑动机
- Boris Cherny 宣布 Claude Mods 落地即出现俄罗斯方块 mod,Thibault Sottiaux 预告 Codex 本周发布密度堪比 DevDay
- 404 Media 曝光 OpenAI 莉莉计划:时薪超 50 美元的审核员查看匿名化聊天记录以校准谄媚口吻
- Trail of Bits 指出 1Password 基准 26% 修复率失真:22% 数据来自刻意错误提示,36% 试验禁止编译测试
今天的 AI Builders Digest 主线是 囚徒困境:Anthropic 与 OpenAI 提议协调放缓前沿 AI 开发并寻求反垄断豁免,Cohere CEO 等批评者直接质疑动机;Matt Turck 用一句话讲完为什么他不信,「玩家太多、经济激励太多、国内国外的囚徒困境太多」。而产品侧完全另一番节奏:Claude Mods 落地当天就有人做出了在 Claude 里玩俄罗斯方块的 mod,Thibault Sottiaux 预告本周的发布密度堪比 DevDay。治理喊减速的同时,引擎在轰油门。
今日总结
主线:放慢前沿进入第三天,叙事从「要不要」变成「凭什么信你」。
动机质疑成为新的主战场。 AI Hot 报道,Anthropic CEO Dario Amodei 呼吁行业与政府协调放缓前沿开发,并寻求反垄断豁免,Sam Altman 与 Elon Musk 表示同意;Cohere CEO 等批评者随即质疑其真实动机。这正是 Gary Marcus 昨日怀疑的展开:当协调放缓需要反垄断豁免时,自律框架与抢跑占位之间的界限变得模糊。Matt Turck 的判断更干脆(34 赞):这个周末很有趣,但我们都明白 AI 进展不会放慢,玩家太多、经济激励太多,国内国外都是囚徒困境。
产品侧给出了相反的证词。 Thibault Sottiaux 征求「Codex 该砍掉什么功能」拿下 8017 赞,今日互动之最;他同时预告本周的发布密度将达到 DevDay 级别。Boris Cherny 宣布 Claude Mods 正式落地(2169 赞),社区当天就做出了 Claude 里的俄罗斯方块。Josh Woodward 披露 Gemini 电力用户小组两个月测了 20 多项早期功能,新一批用户开始试用 Daily Brief 与 Personal Intelligence。实验室的执行机器没有一点减速的迹象。
验证器是 agent 时代的新框架。 Guillermo Rauch 的判断值得裱起来(1182 赞):agent 的上限取决于你给它的证明检查器、编译器、类型系统和 linter,verifiers 加 skills 就是新一代框架。Trail of Bits 对 1Password 基准的方法论拆解是同一主题的评测版:那份「AI 干净修复率 26%」的报告,22% 的数据来自刻意指示智能体应用错误修复的提示词,36% 的试验禁止编译测试,推理档位设置也不一致。基准结论是验证器喂出来的,验证器失真,结论就失真。
隐私的暗面也在今天被照亮。 404 Media 曝光 OpenAI 莉莉计划:时薪超 50 美元的提示词审核员查看匿名化后的真实聊天记录,评判回复是否切题、有没有 AI 式话术和谄媚口吻。模型讨人喜欢的背后,是一支人肉校准队伍。
今日关键词: 囚徒困境 · Claude Mods · 验证器 · 莉莉计划
官方博客
AI Hot:Anthropic 与 OpenAI 提议协调放缓前沿开发,批评者质疑动机
AI Hot·2026-09-15 17:04 CST·原文链接
Anthropic CEO Dario Amodei 呼吁行业与政府协调放缓前沿 AI 开发,并寻求反垄断豁免,Sam Altman 与 Elon Musk 表示同意。
Cohere CEO 等批评者质疑其真实动机。
放慢前沿的叙事走到第三天,第一次出现有分量的反对声:协调本身需要反垄断豁免,这个前提让「自律」与「合谋」的边界变成核心争议。
AI Hot:404 Media 曝光 OpenAI 莉莉计划,人工审核聊天记录以优化模型
AI Hot·2026-09-15 19:48 CST·原文链接
404 Media 披露 OpenAI 内部代号为莉莉计划(Project Lily)的项目:由时薪超 50 美元的提示词审核员查看匿名化后的真实用户聊天记录,评判回复是否切题、是否存在 AI 式话术和谄媚口吻。
匿名化是关键前提,但「真人读你的聊天记录来教模型说话」这件事本身,足以让每个重度用户重新看一眼设置里的数据选项。
AI Hot:Trail of Bits 批评 1Password 的 AI 补丁基准失真,并发布两个验证 Agent 技能
AI Hot·2026-09-15 19:00 CST·原文链接
Trail of Bits 发文批评 1Password 8 月 6 日发布的 FLAWED 报告,称其「26% 的 AI 干净修复率」受四项实验设计选择影响而失真:刻意指示智能体应用错误修复的提示词占 22% 的数据,36% 的试验禁止编译测试,不同试验的推理档位设置也不一致。
Trail of Bits 同时发布了两个补丁验证 Agent 技能。
打完擂台还给工具:与其争论 AI 修复率是多少,不如把验证 Agent 的技能开源出来让所有人自己测。
X/Twitter 动态
Thibault Sottiaux(OpenAI Codex/ChatGPT):该砍掉 Codex 的什么功能?本周发布堪比 DevDay
Thibault Sottiaux(thsottiaux)·2026-09-14 15:01 CST·原文链接1·原文链接2
Sottiaux 的一个提问拿下 8017 赞,是今日互动之最:
What's a feature we should remove from Codex that isn't useful anymore?
让用户投票砍功能,是产品自信的另一种写法。他随后预告(1488 赞):本周的发布密度将达到「你原本预期 DevDay 2025 才有的水平」,并用 Crazy 收尾。治理议程在讨论放慢,Codex 的时间表在加速。
Boris Cherny(Claude Code 负责人):Claude Mods 落地,当天就有俄罗斯方块
Boris Cherny(bcherny)·2026-09-15 01:30 CST·原文链接
Cherny 宣布 Claude Mods 正式上线(2169 赞):社区已经有人做出了在 Claude 里玩俄罗斯方块的 mod,技术细节和更多 demo 见 issue 里的社区更新。
Someone already built a Tetris-in-Claude mod.
Mods 把 Claude 从「一个产品」变成「一个可改装的平台」,落地上线第一天就被社区用最玩世不恭的方式验证了可玩性。
Guillermo Rauch(Vercel CEO):验证器加技能是新一代框架,Cloud Run 之父加入 Vercel
Guillermo Rauch(rauchg)·2026-09-14 23:05 CST·原文链接1·原文链接2·原文链接3
Rauch 今天三条都有分量。人事线(1935 赞):Google Cloud Run 的创造者 Steren 加入 Vercel,将主导 Fluid 家族计算产品(Functions、Containers、Sandbox、Builds),他的判断是「serverless 是云计算的上一章,agent 是下一个前沿,需要为 agent 设计的新计算原语」。
方法论线(1182 赞)是今天最值得收藏的一句:
Agents are only as good as the proof-checkers, compilers, type systems, and linters you give them.
shadcn/lint 帮 agent 守住设计系统规则,他总结道:verifiers 加 skills 就是新的框架。工具线(200 赞):𝚏𝚡 支持自动升级,ctrl+g 重启并恢复会话,0.0.10 对长会话快得多。
Peter Steinberger:又一个实用改进,推进合入 Codex
Peter Steinberger(steipete)·2026-09-15 02:52 CST·原文链接
Steinberger 延续近来的高产出节奏(655 赞):转发一个实用改进并附图,表示正在推进把它也加入 Codex。接昨天「先实测几周、对多数用户有帮助就合入」的承诺,他向 Codex 输送改进的管道正在全速运转。
Josh Woodward(Google Gemini):电力用户小组两个月测了 20 多项功能
Josh Woodward(joshwoodward)·2026-09-15 01:58 CST·原文链接1·原文链接2
Google 的 Josh Woodward 复盘 Gemini 电力用户小组(1001 赞):两个月前启动,用于在应用内测试早期功能,至今已测 20 多项,用户反馈极其给力。新一批用户正在获得 Daily Brief 与 Personal Intelligence 的早期访问,社区会持续滚动的加入。另一条招聘式喊话(181 赞):来和我们一起做设计。
Thariq(Anthropic):上 Latent Space 聊 Claude Code 的技术内幕
Thariq(trq212)·2026-09-15 01:29 CST·原文链接1·原文链接2
Thariq 预告两档内容(381 赞与 393 赞):一是与 Sid 和 Robert 对谈构建 Claude Code 的经历,模型能力变化有多快、跟上有多难,以及他们怀念 AI 之前软件工程的什么;二是刚录完的一期 Latent Space,会非常技术地聊「我们还没怎么公开讲过的事」。Claude Code 幕后视角连着两档播客输出。
Matt Turck(FirstMark VC):AI 进展不会放慢,囚徒困境摆在那里
Matt Turck(mattturck)·2026-09-15 04:00 CST·原文链接
Turck 给放慢前沿的讨论泼了整桶冷水(34 赞,但观点的分量远超赞数):
这个周末很有趣,但我们都明白 AI 进展不会放慢,对吧?玩家太多、经济激励太多,国内国外都是囚徒困境。
这是对「协调放缓」最简洁的博弈论反驳:只要任何一方有动机抢跑,减速协议就守不住。放慢前沿想要成立,得先回答这个问题。
Aaron Levie(Box CEO):是时候上调对 agent 工作负载的想象了
Aaron Levie(levie)·2026-09-15 13:56 CST·原文链接1·原文链接2
Levie 认为所有人都需要更新对 agentic 工作负载的预期(91 赞):agent 蜂群、更强的 computer use、下一波 API 与 MCP 上线、Muse 或 Instinct 这类新形态、垂直企业 agent、后台工作流 agent,这些正在同时涌现。我们会把 agent 扔到远超最初想象的个人与专业任务上。
他同日的另一条(68 赞)补上安全侧:当 agent 使用系统的频率是人类的 100 倍,企业数据保护将成为 21 世纪最复杂的安全与治理挑战之一;锁死一切就没有生产力,放任访问就守不住数据。
数据采集时间:2026-09-15 14:42 CST

评论互动