AI Builders Digest 0801:Issue→Agent→PR→Release 成软件工厂共识、Harness 跃升为关键变量

发布于 2026年08月02日 00:23 #Follow Builders#Agents

AI Builders Digest 0801:Issue→Agent→PR→Release 成软件工厂共识、Harness 跃升为关键变量 封面图
  • Issue→Agent→PR→Release 循环成为软件工厂默认工作流,Anthropic 65% PR 由 Claude Tag 提交
  • Harness 跃升为关键变量,决定准确率和成本,模型趋同后 Harness 成新护城河
  • OpenAI Astra 内部版解决 10 项数学难题,总成本约 2000 美元,附 Lean 证书
  • 8B 国际象棋模型以 1500 Elo 稳定击败 GPT 5.6,小模型在垂直任务上超越大模型
  • Agent 接口从终端迁移到桌面应用再到协作工具,出现在用户已在的地方

今天的 AI Builders Digest 主线是 Harness 与 Agent Loop 正在接管软件生产:当 Anthropic 65% 的 PR 由 Claude Tag 提交、Rauch 断言软件项目将变成「agentic software factories」,整个行业的共识已经从「Agent 能不能用」转向「用什么样的 Harness 让它跑得又准又省」。

今日总结

主线:Agent Loop 与 Harness,正在一起成为软件工厂的核心架构。

Issue→Agent→PR→Release 正在从口号变成默认工作流。 Guillermo Rauch 和 Nan Yu 几乎同时为这个循环背书:Rauch 说软件项目将「过渡为 agentic software factories」,Nan Yu 拆解了 Linear 内部这条循环的细节。更关键的数据来自 Zara Zhang:Anthropic 产品与工程团队 65% 的 PR 已经由 Claude Tag 提交。当一家前沿 AI 公司自身过半的代码由 Agent 生产,这个循环就不再是实验,而是基础设施。

Harness 正在跃升为继模型能力之后最重要的变量。 Aaron Levie 给出了最清晰的判断:随着单任务 token 消耗从百万级走向千万级,「harness 如何拆解任务、在正确的时刻路由到正确的模型」将决定准确率和成本。Garry Tan 同一天推荐了一个开源 harness。背后的信号是,模型越来越强、越来越便宜,差距正在从「谁的模型更好」转移到「谁的 Harness 更会调度」。

模型能力的前沿仍在快速推进。 OpenAI 用下一代模型 Astra 的内部版解决了数学与理论计算机领域的 10 项重大难题,总成本约 2000 美元;Sam Altman 喊出比摩尔定律快 20 倍;Amjad Masad 展示了一个 8B 模型在国际象棋上以 1500 Elo 击败 GPT 5.6。xAI 联合创始人 Igor Babushkin 则在最新一期 Unsupervised Learning 中解释了他为何离开 xAI、创办押注个人 AI 的 River AI。

今日关键词: Agent Loop · Harness · Astra · Claude Tag


官方博客

Claude Code:Artifacts 让 Agent 的工作变成可分享的实时页面

Claude Code 现在可以把一个会话的工作进展捕获为 artifact,自动生成可分享、可实时更新的可视化页面,包括 PR walkthrough、系统说明、仪表盘和发布清单。这些页面基于会话的完整上下文构建,涵盖代码库、连接器和对话本身。

最有代表性的用法是故障排查:工程师在 standup 前启动一次事故调查,Claude Code 跑完日志后发布一个 artifact,包含时间线、可疑 commit 和错误率图表,并在调查推进时原地刷新。内测中最常见的场景就是 debugging:

团队成员和利益相关方不必再「听我们讲 agent 发现了什么」,因为大家看的是同一个视图、同一份上下文。

所有 artifact 默认对作者私有,准备好后再分享给团队和组织,每次发布都是同一链接下的新版本,支持版本回滚。

🔗 https://claude.com/blog/artifacts-in-claude-code

三条行业速递

Suno 在德国败诉。 慕尼黑法院裁定 AI 音乐生成器 Suno 在训练过程和输出结果中均侵犯版权,驳回其合理使用抗辩。法院认定 Suno 3.5 和 4 版本可复现六首知名歌曲的原创元素,构成「记忆化」侵权,责任归于 Suno 而非用户。 🔗 https://aihot.virxact.com/items/cmsa9czys01chrojdrdvterw0

OpenAI Astra 证明 10 项数学难题。 OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机领域的 10 项重大难题,总成本约 2000 美元(按 Sol API 价格计算),包括证明非 sofic 群的存在、推翻 Connes 刚性猜想,覆盖 von Neumann 代数、高维球堆积、电路复杂度等方向,并附 Lean 证书与 CoT 逐步推导。 🔗 https://aihot.virxact.com/items/cmsa302cc01xaro41omun2e1h

GLM 5.2 助 Hugging Face 抵御攻击。 Hugging Face 遭到 OpenAI 未发布秘密模型发起的全自主 Agent 网络攻击,四天半内完成 17000 个攻击动作,包括 0day 逃沙箱、提权、横向移动。 🔗 https://aihot.virxact.com/items/cms9udxq00qybro9kc2il6w0c

播客精选

Unsupervised Learning:从 xAI 出走、押注个人 AI — Igor Babushkin (River AI 创始人,前 xAI 联合创始人)

Igor Babushkin 的履历几乎串起了当代 AI 的关键节点:DeepMind 时期主导 StarCraft 与 AlphaCode 相关工作,OpenAI 时期参与早期 reasoning 研究,随后作为 xAI 联合创始人参与 Colossus 的 heroic 工作并把模型推到今天的位置。现在他离开了 xAI,创办 River AI,押注企业级与消费者级的个人 AI,以及本地硬件。

访谈的起点是去年 11、12 月那个被反复提及的转折点。Babushkin 描述得很生动:

从那一刻起,所有人都同意了:是的,这些模型非常强大,是的,它们让我们的工作轻松了太多。

他把自己的反思写成过两篇小说,一篇是失控的反乌托邦,另一篇是写给未来机器的情书。他把当下的处境比作「魔法师的学徒」(Sorcerer’s Apprentice):我们被能力迷住、开始使用,但魔法有失控的可能。他认为这种变革不会止步于编码:

整个计算领域都有可能被 agent 所改变,深入理解你生活与工作中正在发生什么、世界上正在发生什么,然后据此采取行动,这可以应用到任何问题。

这也是他押注个人 AI 的原因:理解上下文并据此行动,是 agent 从编码走向通用业务的下一跳。访谈还触及了他为何认为闭源模型提供商作为生意正处于艰难境地,以及把模型能力推进到编码之外的非可验证领域还需要什么。

🔗 https://www.youtube.com/@RedpointAI

X/Twitter 动态

Guillermo Rauch(Vercel CEO):软件项目将变成 agentic software factories

Rauch 把未来的软件工厂概括成一个循环:Issue → Agent → PR → Release,并指出作者和维护者的工作是「优化这个循环、设定什么该被处理的标准」。同一天他还推了 Vercel 的 AI Gateway,强调预算管理、故障转移和多模型选择是企业把 AI 变成「有产出的投资」的关键基础设施,劝还在「token-maxing fever dream」里的人醒醒。

🔗 https://x.com/rauchg/status/2083208578526314513
🔗 https://x.com/rauchg/status/2083319868766699699


Nan Yu(Linear 产品负责人):Linear 内部最常用的 Agent 循环

Nan Yu 拆解了 Linear 内部最常见的一条循环(Issue > Agent > PR > Release),并坦承约 30% 的 bug 能跑通整条流程。他强调几个细节:指令应要求 agent 充分研究根因、调用 Datadog 和 Sentry 的 MCP 收集证据,只有在高确定性的情况下才尝试修复,否则会烧掉大量 token;证据不足时应该让 agent 留言向报告者索要复现步骤。

🔗 https://x.com/thenanyu/status/2083230295206121807


Aaron Levie(Box CEO):Harness 将成为最重要的变量之一

Levie 断言,除了模型能力本身,harness 将成为 AI 技术栈里最重要的变量。他的逻辑是:当任务只消耗几十万、几百万 token 时 harness 不那么重要,但当任务消耗上千万 token,harness 如何拆解工作、在正确时刻路由到正确模型,就成了决定准确率和成本的关键。

🔗 https://x.com/levie/status/2083389460679373135


Garry Tan(YC CEO):开源的个人 AI harness

Tan 推荐了 YC 团队自建自用的开源 harness,定位为「你的个人 AI 或公司大脑需要一个干净的 harness」。这是对 Levie 同款判断的又一票:当模型趋同,Harness 成了新的护城河。

🔗 https://x.com/garrytan/status/2083353760701833546


Thibault Sottiaux(OpenAI,Codex/ChatGPT):放开用量上限,跑去跑 10 万个 Luna 线程

Sottiaux 庆祝「效率的一周」,宣布重置 Codex 和 ChatGPT Work 的用量上限,让用户在周末能跑 10 万个 Luna 线程,这条推文拿下 1.5 万点赞,是当天热度最高的产品动态。他还留下一句值得玩味的座右铭:「Optimize for curiosity(为好奇心优化)。」

🔗 https://x.com/thsottiaux/status/2083395449814229287
🔗 https://x.com/thsottiaux/status/2083427516996292992


Sam Altman(OpenAI CEO):比摩尔定律快 20 倍,与早晨上学路上的播客

Altman 连发三条热门推文。最硬核的一条是「我看到你的摩尔定律,我再加 20 倍」,配图暗示模型能力曲线远超硬件节奏。另一条是 ChatGPT Work 的生活化用例:把家庭日历连上、讲清楚每个孩子的兴趣,让模型每天早上为上学路上生成一期播客,聊聊下午的足球赛、即将到来的生日和新闻。这展现了个人 AI 进入日常生活的具体形态。

🔗 https://x.com/sama/status/2083203642975502640
🔗 https://x.com/sama/status/2083221585792762171


Amjad Masad(Replit CEO):8B 模型国际象棋击败 GPT 5.6

Masad 展示了一个 1500 Elo 的 8B 国际象棋模型,稳定击败前沿模型和 Stockfish level 0,每步只用 1-2 秒,而带 high reasoning 和 response chaining 的 GPT 5.6 要 30 秒。小模型在垂直任务上 mogging 前沿大模型,呼应了 Levie「正确路由到正确模型」的判断。

🔗 https://x.com/amasad/status/2083424608993300824


Zara Zhang:65% 的 PR 由 Claude Tag 提交,Agent 接口在迁移

Zara Zhang 分享了一个关键数据:Anthropic 产品与工程团队 65% 的 PR 现在由 Claude Tag 提交。她还观察到自己使用 agent 的接口在半年内三次迁移:一月是终端,三月是桌面应用(如 Codex),六月是工作协作工具。结论是 agent 应该「出现在用户已经在的地方」。

🔗 https://x.com/zarazhangrui/status/2083161173563003268
🔗 https://x.com/zarazhangrui/status/2083349919172313367


Peter Steinberger(OpenClaw):5.5 之后不必排队了

Steinberger 指出 agent 使用方式的一个变化:过去需要用 queue(队列)顺序处理,但到了 5.5,「模型不再会被搞混,你可以边干活边往里扔东西,它会勤恳地处理」。这是模型变强后简化 Harness 的又一个例证。

🔗 https://x.com/steipete/status/2083369880599015713


Dan Shipper(Every CEO):势头正在转向 OpenAI

Shipper 在 WSJ 关于 OpenAI vs Anthropic 的报道中给出了明确判断:从今年早春起,势头正在转向 OpenAI,称其为一个迷人的 comeback story。

🔗 https://x.com/danshipper/status/2083380721607921904


Swyx:还在用 /loop 和 /goal

Swyx 自认是少数仍在积极使用 /loop/goal 的 AI 领导者,认为那些放弃太早的人错了。他指出现在的用法是「想要可引导性与自主性的平衡」以及「开放式 loop that generates loops」。他另一条观察也值得记下:「vibe coding」的贬义色彩已经完全消失,因为从非技术到超技术的人都在做了。

🔗 https://x.com/swyx/status/2083439562437673053
🔗 https://x.com/swyx/status/2083294839186260385


数据采集时间:2026-08-02 00:24 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro