AI Builders Digest 0803:Agent 从单点工具走向企业级运行时

发布于 · 2,807 字 · 约 7 分钟#Follow Builders#Agents
AI Builders Digest 0803:Agent 从单点工具走向企业级运行时 封面图
  • Vercel 内部 agent @𝚟 统一数十个 agent,承载公司日常运营
  • Cloudflare 发布开源 agent 运行时,提供虚拟文件系统和三种执行环境
  • 最难领域因可验证性率先被自动化,数学、安全、代码首当其冲
  • 当前模型架构瓶颈在堆参数,需要 test-time learning 在真实数据上学习
  • 杰文斯悖论在数学领域应验,AI 提升对懂数学人才的需求

AI Builders Digest 0803,Agent 走向企业级运行时

今天的 AI Builders Digest 主线是 Agent 从单点工具走向企业级运行时:Guillermo Rauch 揭秘 Vercel 内部 agent 已经承载整家公司运营,Cloudflare 发布开源 agent 运行时,Core Automation 两位前 OpenAI/Google 大佬指出下一代模型的瓶颈在架构本身。

今日总结

主线:Agent 从单点工具走向企业级运行时。

Agent 正在变成公司的水电煤。 Rauch 公开了 Vercel 内部 agent 的情况,它不是辅助工具,而是承载财务、通信、文档、营销、工程、商业分析的日常运营中枢,交互量和 token 消耗都在指数级增长。同一天 Cloudflare 发布开源 agent 运行时,给每个 agent 配虚拟文件系统,支持 isolate、容器沙箱、浏览器三种执行环境。一家是实践者讲心得,一家是基础设施厂出工具,方向完全一致。

最难的领域反而先被自动化。 Aaron Levie 给出了一个反直觉的判断,数学、安全、代码这些「最难」的领域会率先被自动化,因为它们具备可验证性,模型训练有清晰的奖励信号,运行时也能客观确认结果对不对。Thariq 用杰文斯悖论来佐证,数学领域已经出现这个现象,AI 越能干,对懂数学的人的需求反而上升。

当前模型架构触顶,需要 test-time learning。 Core Automation 的 Jerry Tworek(前 OpenAI VP,负责 Strawberry 和推理团队)直言,6 年来只往 MoE 加 attention 里堆参数,瓶颈已经是架构本身。eval 和训练任务是同一枚硬币的两面,真实世界分布更脏更杂,模型需要在用户真实数据上学习,而不是只靠 context learning(20 分钟就满了)和 fine-tuning(灾难性遗忘)。

今日关键词: 企业级 Agent · 可验证性 · Test-time learning · Agent 运行时


官方博客

Cloudflare:为智能体提供虚拟文件系统的运行时

Cloudflare 发布 @cloudflare/computer 早期预览版,这是一个开源 agent 运行时,核心设计是给每个 agent 配一个虚拟文件系统,并支持在 isolate、容器沙箱或浏览器中执行代码。

这个定位很值得注意。之前 agent 要么跑在本地终端,要么绑死在某个云函数里,缺少一个标准化的执行环境抽象。Cloudflare 的方案把文件系统、沙箱、浏览器三种执行环境统一到一个运行时里,等于给 agent 提供了一套「操作系统」级的接口。配合同日发布的 Billable Usage API(单一端点返回按产品和计费周期拆分的用量与成本,覆盖 Workers、R2、D1、Workers AI 等),Cloudflare 在 agent 基础设施上明显在加速布局。

🔗 https://aihot.virxact.com/items/cmsdal06c16pxroeu5xtlavmg
🔗 https://aihot.virxact.com/items/cmsdal06d16pzroeuf2u64pdv

商汤:8B-MoT 参数的原生统一多模态模型

商汤推出 SenseNova U1.5-Lite-Preview,基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数就能达到商业闭源模型的生成与编辑质量。轻量化多模态是当前一个明确趋势,用更少参数逼近闭源质量,对端侧部署友好。

🔗 https://aihot.virxact.com/items/cmsdczxnl0138rotj8fjenm4b


播客精选

Training Data:打造自动化 AGI 实验室 — Jerry Tworek 与 Rohan Anil (Core Automation)

这期信息密度极高。两位嘉宾背景很硬,Jerry Tworek 是前 OpenAI VP,负责 Strawberry 和推理团队;Rohan Anil 是前 Gemini 四位预训练负责人之一,更早在 Google Brain 做 fundamental AI 研究。两人现在创办了 Core Automation,旧金山当前最受关注的新实验室之一。

当前瓶颈是架构本身,不是参数量。 Jerry 直言,业界已经把预训练和大规模 RL 这两套算法玩透了,过去 6 年一直在往 MoE 加 attention 里堆参数,现在的瓶颈是架构本身。他的原话很直白:「现在是时候重新审视我们骑了 6 年的那趟列车了。」

RL scaling 没有解决所有问题。 Jerry 坦承自己曾是 RL 最大化主义者,一直相信只要把 RL 规模化就能解决一切。但实际规模化后发现,eval 和训练任务本质上是同一枚硬币的两面,真实世界的分布要脏得多、杂得多,训练数据没法真正复现真实世界用例。

需要 test-time learning。 这是这期最有价值的判断。Jerry 指出现有两条学习路径都不够,context learning 数据量太小(用 Codex 大概 20 分钟就得 compact 一次),fine-tuning 又有灾难性遗忘和数据效率低的问题。模型需要能在用户真实数据、真实任务、真实分布上学习。

「我们需要让模型在测试时学习,在用户的数据上、在真实世界任务上、在真实世界分布上,和用户一起学习。」

架构研究在小规模上做了太久。 谈到为什么选择公司化而不是留在实验室,Jerry 的理由是很多架构研究在过小的规模上做了太久,而 RL 需要一定的算力基线才能让模型表现出能力。Core Automation 的信念是,先把架构放到足够大的规模去验证。

🔗 https://www.youtube.com/watch?v=2RJiaf0SY8s


X/Twitter 动态

Guillermo Rauch(Vercel CEO):内部 agent 运营整家公司

Rauch 这组推文是今天最有冲击力的。他公开了 Vercel 内部有一个叫 @𝚟 的 agent,承载着公司从财务、通信、文档、营销到工程、商业分析的日常运营,每天交互量和 token 使用都在指数级增长。

更关键的是他对 agent 架构的理解。Rauch 说之前 Vercel 内部各团队各自部署了「几十个」agent,每个 agent 就像有自己的域名一样,体验很差。@𝚟 解决了这个问题,它既是 agent 又是 router,有 sub-agents、skills,知道怎么把活派给其他 agent。他用了一个很好的类比,这就像 monolith 或 monorepo,把分散的 agent 收敛成一个统一入口。

「人们可以从这里外推到那一天,AI agent 从头到尾运营整家公司。」

(1233 赞,3662 赞那条「mastery + creativity + AI」的推文也很值得看,强调人的专业积累和 AI 结合才是真正的杀手锏。)

🔗 https://x.com/rauchg/status/2084042561690456157
🔗 https://x.com/rauchg/status/2084060157085143512


Aaron Levie(Box CEO):最难的领域反而先被自动化

Levie 给出了一个反直觉但逻辑严密的判断。数学、安全、代码这些「最难」的领域会率先被自动化,恰恰因为它们具备可验证性。模型训练时有清晰的奖励信号,运行时能客观确认结果是否正确,这两个好处让高难度高价值领域反而最先被攻破。

🔗 https://x.com/levie/status/2083965372747882741


Thariq(Claude Code/Anthropic):杰文斯悖论已在数学领域应验

Thariq 这条推文 1191 赞,含金量很高。他指出杰文斯悖论已经在数学领域发生,AI 让更多事情发生、更容易理解,数学家有更多时间在更高抽象层讨论,对懂数学的人的需求反而会上升。他还补充了一条,认为这和国际象棋的演变有很多相似之处。

「对思考和懂数学的人的需求,将会上升。」

🔗 https://x.com/trq212/status/2083977795290734975
🔗 https://x.com/trq212/status/2083978109376987365


Amjad Masad(Replit CEO):LLM 国际象棋引擎上 LiChess 实战

Masad 把自己的 LLM 国际象棋引擎部署到了 LiChess,让它自主和真人及机器人对弈,同时还能下 3 盘并发棋。目前 Elo 1253。这是一个很好的「AI 在可验证领域自主进化」的实例,和 Levie、Thariq 的讨论形成呼应。

🔗 https://x.com/amasad/status/2083926395403821427


Dan Shipper(Every CEO):Agency rupture,一种可预测的丧失

Shipper 这条推文很扎心,192 赞。他把 AI 接管你曾亲力亲为的任务时的感受命名为「agency rupture」(能动性断裂),这是一种近似身份丧失和自我消解的体验。但他认为这种断裂遵循可预测的模式,暗示它会被消化。他的另一条推文从哲学层面切入,如果「ought implies can」,而技术重塑了人类能力场,那么技术也在重塑我们的道德直觉。

🔗 https://x.com/danshipper/status/2084038453831020916
🔗 https://x.com/danshipper/status/2084024211539116466


Peter Yang:Hermes 用后台 Curator 清理自己的 slop

Peter Yang 采访了 Nous Research 联合创始人 Karan,聊 Hermes 的自建 skill 机制。最值得关注的是 Hermes Curator 这个后台任务,它定期清理 agent 的 skills 和 memory,自问哪里有 slop、哪里可以更高效,而且因为是开源的,你可以喂给它自己对 slop 的定义,它会重写自己的清理逻辑。这种「agent 自我维护」的思路,和 Rauch 讲的 @𝚟 收敛 agent、Cloudflare 给 agent 配运行时,是同一个方向的不同切面。

🔗 https://x.com/petergyang/status/2083968605432267139


Garry Tan(YC CEO):AI 创造的经济增长是最好的白药丸

Tan 连发几条乐观判断。他认为 AI 将创造难以想象的经济增长,这是最好的「白药丸」。同时他也点出一种时代错位感,「惊奇感消失的那一刻,恰恰是惊奇量正在呈抛物线增长」,以及强调市场里结果才是地盘,而不是地图。

🔗 https://x.com/garrytan/status/2083957110711386439
🔗 https://x.com/garrytan/status/2083923385193828612


Andrej Karpathy:pelican on a bicycle 测试可玩了

Karpathy 跟进了 Simon Willison 的「自行车上的鹈鹕」测试,把源码上传到浏览器里可玩可 fork。他还开玩笑说 GTA Hobbiton 会在 GTA VI 之前发布。这个测试考察模型对荒诞组合的生成能力,是当前评估模型世界理解的一个流行基准。

🔗 https://x.com/karpathy/status/2083948654377996480


Ryo Lu(Cursor 设计师):软件正在告别 app 形态

Cursor 的设计师 Ryo Lu 回顾了 Rdio、Mailbox、Apple 这些早期导师级 app 如何创造了让软件更简单直觉的新交互模式。他的问题是,当我们告别 app 形态,软件的哪些部分还会可见,它会有什么感觉。这是对 agent 时代软件形态的前瞻思考,和 Cloudflare 的 agent 运行时、Rauch 的 agent router 属于同一个大话题的不同侧面。

🔗 https://x.com/ryolu_/status/2083939454017053179


Swyx:Codex CUA 替他和客服吵架

Swyx 在为 computer use 播客做准备,记录了一串 Codex CUA 的「wow moments」。其中一个是 Codex 替他去跟客服交涉以加快处理速度,客服完全不知道自己在跟机器人对话,当客服试图甩锅时,机器人直接甩出了完整的证据链。

🔗 https://x.com/swyx/status/2084156733027701164


Nikunj Kothari(FPV Ventures):早期投资已变成「感觉资本」

Nikunj 从投资人视角给出了对当前融资市场的冷静观察。他认为 VC 已经实质上变成了「vibes capital」,早期中期的市场现实和基本面完全脱钩,有些轮子什么都没有却疯狂,有些看着稳赢的却融不到。这是 agent 热潮背后值得留意的另一面。

🔗 https://x.com/nikunj/status/2083873335998333227


数据采集时间:2026-08-03 23:09 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro