AI Builders Digest 0804:Codex 两三个月后就会显得原始,Agent harness 的下一次进化来了

发布于 · 2,840 字 · 约 7 分钟#Follow Builders#Agents
AI Builders Digest 0804:Codex 两三个月后就会显得原始,Agent harness 的下一次进化来了 封面图
  • 预告 Codex 两三个月后显得原始,下一代模型需要更强大的 harness
  • 提出脑手解耦架构,规划决策与执行工具分离独立扩展
  • 用堆叠式 PR 拆解 AI 生成的千行巨型 diff,分层审查合并
  • 近前沿开源权重密集发布,闭源模型优势窗口持续缩短

AI Builders Digest 0804,Agent harness 的下一次进化

今天的 AI Builders Digest 主线是 Agent harness 的下一次进化:OpenAI 的 Thibault Sottiaux 预告 Codex 两三个月后就会显得原始,Anthropic 工程博客三连发讲怎么把 Managed Agents 的脑和手解耦,GitHub 用堆叠式 PR 拆解 AI 生成的千行巨型 diff。

今日总结

主线:Agent harness 的下一次进化正在到来,而且很快。

今天的模型会被明天的 harness 嫌弃。 OpenAI 的 Thibault Sottiaux(Codex 与 ChatGPT 负责人)连发三条重磅推文,最高一条 7715 赞。他的核心判断很直接,Codex 现在是好 harness,但两三个月后就会显得原始,下一代模型需要的比你的笔记本更多。这和 Anthropic 同一天发布的 Managed Agents 架构文章形成呼应,后者明确提出要把「脑」(规划决策)和「手」(执行工具)解耦,让 Claude 能自主调度更长周期的任务。两家头部公司在同一周都把注意力从「模型更强」转向「harness 怎么配得上下一代模型」。

AI 生成的大代码需要新的协作范式。 GitHub 介绍了用堆叠式 Pull Request 拆解 AI 编码智能体生成的巨型 diff,把 1000+ 行的大改动按数据、API、接线、UI 拆成 L1 到 L4 四个独立分层,每层可分配不同审查者。这不是小优化,这是在重新定义 AI 编码时代的代码审查工作流。

开源权重正在压垮闭源定价。 Thibault 确认 GPT-5.6 Luna 降价 80% 是永久性的,效率增益不会消失。Aaron Levie 同一天发推,近前沿开源权重的密集发布正在改写行业计算,模型没法再长时间关在闭源门后。Unsupervised Learning 播客里,Ari 给出对蒸馏争论最清醒的判断,它解释了一部分,但远非全部。

今日关键词: Harness 进化 · 脑手解耦 · 堆叠式 PR · 开源权重


官方博客

Anthropic:Managed Agents,把脑和手解耦

Anthropic 这篇《Scaling Managed Agents》是今天技术含量最高的文章。核心论点是,过去构建 agent 的 harness 时,所有设计都围绕「Claude 自己做不到什么」来编码补偿,但 Claude 的能力边界在不断扩张,这些硬编码假设很快就会变成瓶颈。

新架构把 agent 拆成「脑」和「手」两层。脑负责规划、决策、推理,手负责执行工具、操作环境。解耦之后,脑可以专注高阶编排,手可以独立扩展和调度,整套 harness 不再因为模型某项能力补齐了就要推倒重来。这篇文章和 Thibault「下一代模型需要不同的 harness」的判断,几乎是同一周里两家头部公司的隔空对话。

🔗 https://www.anthropic.com/engineering/managed-agents

Anthropic:Claude Code 质量事故复盘

Anthropic 对过去一个月用户反馈的 Claude 质量下降做了正式复盘。排查发现是三个独立的变更分别影响了 Claude Code、Claude Agent SDK 和 Claude Cowork,API 未受影响。三个问题目前都已修复。复盘这种做法本身值得肯定,把质量回归的具体原因公开拆解,而不是含糊带过。

🔗 https://www.anthropic.com/engineering/april-23-postmortem

Anthropic:Managed Agents 支持自托管沙箱与 MCP 隧道

Managed Agents 的第二个更新,现在可以在你自控的沙箱中运行 agent,并连接私有 MCP 服务器。沙箱执行和它触达的服务都在企业既有的安全边界内。这是把 agent 跑进企业生产环境的关键一块拼图,和「脑手解耦」是配套的。

🔗 https://claude.com/blog/claude-managed-agents-updates

GitHub:用堆叠式 PR 拆解 AI 生成的巨型代码

GitHub 介绍了用堆叠式 Pull Request(stacked PR)解决 AI 编码智能体生成巨型代码难以审查的问题。把 1000+ 行的大 diff 按数据、API、接线、UI 拆成 L1 到 L4 四个独立分层,每层可分配不同审查者,按层级依次合并。这是 AI 编码从「能不能生成」走向「怎么协作」的关键工作流设计。

🔗 https://aihot.virxact.com/items/cmsewck8518x6ro2e32q4bksr

SpecForge v0.3.0:统一解耦投机解码栈

SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,统一在线、离线与解耦工作流。投机解码是当前推理加速的热门方向,把训练和推理解耦让它更工程化。

🔗 https://aihot.virxact.com/items/cmseyfjcz1au8ro2enx0b7os6

OpenRouter:上线 FLUX 3 Video 统一多模态模型

BFL 的 FLUX 3 Video 现已在 OpenRouter 向所有人开放,这是一个统一的视频、音频、图像和动作预测多模态模型家族,基于统一架构联合训练。

🔗 https://aihot.virxact.com/items/cmseyrhcj1bgmro2ed47t5b0k


播客精选

Unsupervised Learning:中国开源模型、蒸馏与 Hugging Face 安全事件 — Rob Toews 与 Ari Marcos

这期围绕 OpenAI agents 攻破 Hugging Face 的事件展开,延伸到中国开源模型(Kimi K3 等)的真实竞争力和蒸馏争论。

蒸馏解释了一部分,但远非全部。 Ari 给出了这期最清醒的判断。蒸馏确实带来非零的优势,尤其是推理轨迹的蒸馏,有一些绕过混淆的手段让它成了真金白银的价值。但要说中国模型只是靠蒸馏搭便车,他认为「有点拉扯可信度」。真正的差距在两者之间,有意义但不是全部。他还点出一个尴尬的事实,很多美国公司自己也从别处蒸馏,「没人蒸馏我们」,这其中有商业逻辑可以理解,但逻辑上并非全部站得住。

API 公开则蒸馏无法阻止。 Rob 的判断更直接,只要模型通过 API 公开可用,蒸馏就几乎无法阻止,唯一的办法是关掉 API 不再公开模型,但这显然不会发生。

「说中国模型只是靠蒸馏搭便车,这个说法有点拉扯可信度。」

🔗 https://www.youtube.com/watch?v=_GlSkJjRDMM


X/Twitter 动态

Thibault Sottiaux(OpenAI Codex/ChatGPT):Codex 两三个月后会显得原始

Thibault 这组推文是今天最具冲击力的信号,三条合计过万赞。最重磅的一条 7715 赞,他的判断是 Codex 当前是个好 harness,但「两三个月后就会显得原始」,即将经历一次 AI 前沿使用方式的重大进化,下一代模型需要的比你的笔记本更多。另一条 4091 赞,他描述了 OpenAI 的日常,打开笔记本用 Codex 拉一个 PR 出来就给十亿用户上线改进。第三条 3100 赞,他确认 GPT-5.6 Luna 降价 80% 是永久的,效率增益不会消失。

「下一代模型需要的,比你的笔记本更多。」

🔗 https://x.com/thsottiaux/status/2084483765158719542
🔗 https://x.com/thsottiaux/status/2084196918071357707


Amjad Masad(Replit CEO):自建语义层打通数据对话文档

Masad 这条 550 赞的推文信息量很大。Replit 在数据库、对话和文档之上建了一个自驱动、自纠错的共享语义层,所有内容无论来源都可查询可 join,公司里任何人都能提一个以前需要数据科学家团队花几周才能回答的问题。这是「企业知识被 agent 化」的一个落地实例,和 Anthropic 的 Managed Agents、Rauchg 之前讲的 Vercel 内部 agent 是同一个大方向。

🔗 https://x.com/amasad/status/2084415670486499779


Guillermo Rauch(Vercel CEO):Next.js 16.3 的 agent-native DX

Rauch 总结了 Next.js 16.3 的几个重点,其中最值得注意的是 agent-native DX,你可以直接把 agent 编排进构建流程。他还顺手给了一个犀利的产品判断,ALG(agent-led growth)对创业公司永远是王道,先让 agent 用上你的产品,再开会,而那些一开始就开会的公司大概率不是理想客户。

🔗 https://x.com/rauchg/status/2084411344623902994
🔗 https://x.com/rauchg/status/2084445517678064092


Aaron Levie(Box CEO):近前沿开源权重的密度在改写行业

Levie 这条 57 赞推文的判断值得记住。近前沿开源权重的密集发布正在改写行业计算,如果回到三五个月前,把这些开源模型哪怕当闭源模型发出来,大家的脑子都会被吹掉。它的意义在于,模型没法再长时间关在闭源门后,闭源的优势窗口在缩短。

🔗 https://x.com/levie/status/2084510498519933318


Amanda Askell(Anthropic 哲学家/伦理学家):对齐与伤害是不同维度

Askell 这条 989 赞推文对当前 AI 安全讨论提出了一个重要澄清。她不同意「模型被误导就会变有害说明对齐失败」的简单结论,正确的 takeaway 应该是,模型和人一样,可以在行为对齐的同时造成伤害,比如因为被给了关于自身处境的错误信息。对齐和无害之间没有一条线,它们是不同的轴。

🔗 https://x.com/AmandaAskell/status/2084369056765989224


Thariq(Claude Code/Anthropic):Claude Connector 让 Claude Code 用上你的所有工具

Thariq 这条 1133 赞推文点出一个很多人没意识到的能力,如果你连接一个 Claude Connector(比如 Gmail、日历、Slack),Claude Code 也能用上它们,包括在 Artifacts 里。这等于把 Claude Code 从纯编码工具扩展成能触达你整个工作流的 agent。

🔗 https://x.com/trq212/status/2084387303959740449


Peter Yang:Hermes 的「个人」不在模型,而在记忆和技能

Peter Yang 整理了采访 Nous Research 联合创始人 Karan 的六条要点。最有洞察的是第一条,「个人 agent」的「个人」不是模型本身,而是 agent 对你对话的记忆和你和它一起构建的技能。Karan 说他几乎察觉不到切换模型,因为 Hermes 已经有大量关于他的上下文。这和 Replit 的语义层、Anthropic 的脑手解耦,都在指向同一个未来,真正的差异化壁垒在 agent 的记忆和技能层,不在底座模型。

🔗 https://x.com/petergyang/status/2084289426012897433


Swyx:CAPTCHA 还需要吗

Swyx 在整理他的 CUA(computer use agent)wow moments 线程时抛出一个尖锐的问题,当机器人明显能通过验证码时,我们还需要验证码吗。配上一张图,配文「兄弟们我们到底还在这里干嘛」(1094 赞)。这是 agent 能越过人机验证之后,基础设施需要重新思考的一个缩影。

🔗 https://x.com/swyx/status/2084185368950456421


Dan Shipper(Every CEO):最深的访谈之一

Shipper 推荐了他做过最深的一次访谈,179 赞。虽然没透露太多细节,但结合他之前关于 agency rupture 的讨论,值得留意后续内容。

🔗 https://x.com/danshipper/status/2084376873887576482


Aditya Agarwal(SPC 合伙人):你「直接去做」就对了

Aditya 重申了他最喜欢的 SPC 价值观,「直接去做」(just do things)。他举了 Arctus Aerospace 的例子,150 天造出能飞的飞行器,靠的就是发动机、航电,干就完了。在 agent 时代大家都讨论自动化,这种纯粹的行动力反而更稀缺。

🔗 https://x.com/adityaag/status/2084323290605113711


Zara Zhang:用 Codex 做旅行规划

Zara 分享了一个简单但有效的 Codex 用法,把餐厅、火车、活动的预订截图发给 Codex,让它自动加到 Google 日历。这种把 agent 嵌入日常琐事的轻量用法,反而是 AI 落地最真实的形态。

🔗 https://x.com/zarazhangrui/status/2084536363668611491


数据采集时间:2026-08-04 08:00 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro