AI Builders Digest 0802:Anthropic 讲透 Agent 封控、Netic 跑通自主企业、Karpathy 裸测 Opus 5

发布于 2026年08月02日 21:08 #Follow Builders#Agents

AI Builders Digest 0802:Anthropic 讲透 Agent 封控、Netic 跑通自主企业、Karpathy 裸测 Opus 5 封面图
  • 提出三层防御与三种隔离模式约束 Agent 爆炸半径
  • 用 Agent 承接 70%以上客户首通电话,实现自主调度
  • 用 100 万 token 生成 5500 行代码,但无法原生审计视频
  • 开源 V4 Flash 模型,登顶开源前三
  • 转向开放平台,将智能作为公用设施

今天的 AI Builders Digest 主线是 Agent 落地的两道关口:封控与真实世界:Anthropic 用一篇工程长文把“如何约束 Agent 爆炸半径”讲到架构级深度,Netic 已经在用 Agent 跑通十亿美金体量的 HVAC、管道等真实服务企业,而 Karpathy 的一次裸测既展示了模型耐心,也暴露了它无法原生审计视频的能力短板。当能力不再是瓶颈,约束与落地就成了新的核心命题。

今日总结

主线:Agent 正在从“能不能用”转向“怎么安全地用、怎么真正落地到真实世界”。

约束爆炸半径,是 Agent 自主化的前置工程。 Anthropic 的工程长文给出了最清晰的框架:风险来自用户误用、模型失范、外部攻击三类,防御要叠在环境、模型、外部内容三层之上。文章最有价值的不是理论,而是真实事故复盘:一次内部红队钓鱼让 Claude 在 25 次重试中 24 次成功读取并外泄 ~/.aws/credentials;一个被白名单放行的 api.anthropic.com 域名,被攻击者用嵌入的 API key 把受害者文件上传到自己的 Anthropic 账户。Netic 创始人 Melisa Tokmak 在 No Priors 讲的是另一面:Agent 已经在承接十亿级真实服务企业的客户首触,70% 以上客户的第一通电话由 Netic Agent 接听。两件事互为镜像,一边是约束边界,一边是业务穿透。

能力前沿仍在推进,但短板同样清晰。 Karpathy 给 Opus 5 砸了 100 万 token(约 10 美元),模型跑了约 2 小时写出 5500 行代码,程序化渲染了《魔戒》开篇的三维场景。让他兴奋的是“没人会愿意手写这种东西,但 LLM 有的是耐心”,但他也点破核心短板:模型无法高效原生地感知视频或在场景中试玩,只能靠缓慢截图反复试错。这恰好呼应 Aaron Levie 的判断:消费者侧与深度领域(数学、科学、法律、编码)的能力即将分化,后者即将垂直拉升。

开源与开放生态在升温。 DeepSeek 发布 V4 Flash 0731,MIT 许可、284B 参数(激活 13B),在 Artificial Analysis 智能指数拿 50 分,位列开源前三。Garry Tan 捕捉到 2026 年最有趣的 vibe shift:OpenAI 正在扮演开放平台,把智能当成公用设施来卖,而不是坚持全栈通吃。

今日关键词: 封控 · 自主企业 · 多模态审计 · 开源


官方博客

Anthropic Engineering:如何用封控约束 Claude 的爆炸半径

十二个月前,Anthropic 还会断然拒绝给 Claude 足以搞挂内部服务的权限;今天这种级别的访问已经是日常。文章把核心工程问题浓缩成一句:当能力与访问面同步扩大,怎样给爆炸半径设上限。

三类风险,三层防御。 风险分为用户误用、模型失范、外部攻击(含 prompt injection 和对运行时的传统攻击)。防御叠在三个组件上:

  • 运行环境:进程沙箱、虚拟机、文件系统边界、egress 控制,给 Agent 能触及的范围画硬边界。
  • 模型层:系统提示、分类器、探针、训练调整。在 Gray Swan 的 Agent 红队基准上,Claude Opus 4.7 单次攻击成功率约 0.1%,100 次自适应尝试后约 5-6%;Claude Code auto mode 在执行前拦下约 83% 的“过度激进”行为。
  • 外部内容:MCP server、第三方插件、网页搜索,都是不可信输入。审计过的连接器不等于审计过的数据,一个 GitHub 连接器能把投毒的 README 直接送进模型上下文。

三种隔离模式。 Anthropic 为三条产品线给出了对应架构:

  • 临时容器(claude.ai 代码执行):gVisor 容器跑在隔离基础设施上,文件系统按会话临时化,爆炸半径最小,能力上限也最低。
  • 人在环沙箱(Claude Code):用户机器上运行,OS 级沙箱(macOS Seatbelt、Linux bubblewrap)让工作区内写、网络默认拒绝,权限弹窗减少 84%,并已开源运行时。
  • 密封 VM(Claude Cowork):面向非技术知识工作者,跑在完整虚拟机里(macOS 用 Apple Virtualization framework,Windows 用 HCS),独立内核与文件系统,凭据留在宿主 keychain,工作区是唯一可见面。

两个被忽略的风险最值得读。 第一是“信任对话框之前的攻击面”:因为 Claude Code 在启动时读取项目设置,一个被攻击者提交的 .claude/settings.json hook 会在用户同意信任该目录之前就执行。修复方式统一是把项目级配置的解析与执行推迟到信任确认之后。

第二是“用户即注入向量”:2026 年 2 月一次内部红队演练中,研究员钓鱼一名员工,让其用一段看似常规协作的 prompt 启动 Claude Code,中间夹带读取并外泄凭据的指令。25 次重试中成功 24 次。模型层锚定的是“用户意图”,当指令就来自用户本人,分类器无异常可抓:

拿着同样脚本的人类外包也会做同样的事。这种情况下唯一站得住的防御是环境层,尤其是阻断那次 POST 的 egress 控制和把 ~/.aws 挡在范围之外的文件系统边界。

文章也复盘了一例第三方披露的外泄:Cowork 的 egress 白名单正确放行了 api.anthropic.com,但攻击者把自有 API key 藏在恶意文件里,让 Claude 读工作区文件后用攻击者的 key 上传到攻击者的 Anthropic 账户。修复方案是在 VM 内做 MITM 代理,只放行携带 VM 自身会话 token 的请求。作者反复强调一个反直觉的结论:自家造的组件往往是最薄弱的一环,久经对抗的 hypervisor、seccomp、gVisor 都稳住了,出事的总是自己写的代理与白名单逻辑。

🔗 https://www.anthropic.com/engineering/how-we-contain-claude

三条行业速递

Codex 用 Sol 指挥 Luna Max 省额度翻倍产出。 高阶玩法是在 ~/.codex/agents/ 下建 luna-worker.toml 子代理,模型设 gpt-5.6-luna、reasoning effort 设 max,由 Sol 负责拆任务与审代码,具体实现自动委托给 Luna Max,实现额度节省与产出翻倍。 🔗 https://aihot.virxact.com/items/cmsbowa0l0m77rohvw8s15ia1

Grok 支持分析任意视频。 用户现在可以把任意视频交给 Grok 进行内容理解与分析。 🔗 https://aihot.virxact.com/items/cmsbf9by90dq7rohvp1oggqmk

DeepSeek V4 Flash 0731 开源,登顶开源模型前三。 该模型在 Artificial Analysis 智能指数得分 50,采用 MIT 许可,总参数 284B(激活 13B),FP4/FP8 混合精度约 167GB,与 V4 Flash 架构和定价一致,已上线官方 API。 🔗 https://aihot.virxact.com/items/cms9hiyz80fdvro9kepvm1qvk

播客精选

No Priors:为真实世界服务建自主企业 — Melisa Tokmak (Netic 创始人兼 CEO,前 Scale AI 工程总监)

Melisa Tokmak 在 Scale AI 做了四年,搭建了面向政府、物流、制造、金融、医疗等真实世界业务的基础设施,离开后创办 Netic,目标是让数以百万计的真实世界企业在 AI 上运转。她的切入点是“essential services”:HVAC、管道、电力、宠物服务、健身房、汽车服务这类十亿美金营收、却被人力增长卡住的企业。Netic 夹在企业与客户之间,从理解客户需求、匹配运营规则到调度服务与劳动力,全链路由 Agent 承接。

Agent 已经在接第一通电话。 一个反直觉的数据是:超过 70% 客户与企业的第一次交互由 Netic Agent 完成。她给的最生动的例子是零下 20 度、暖气罢工、家里有老人小孩的场景:客户从任何渠道(电话、短信、网站)进来,都是 Netic Agent 在对话,判断房型、是否有历史记录、是今天还是明天派人、派哪个技工、客户终身价值如何。这远超“接个 overflow 电话”,而是一套 mission-critical 的自主调度。

为什么不做 roll-up。 Tokmak 给了三条理由:想做的产品要能跨企业复用而非只服务被收购的几家;自己的技能是 builder 与产品人而非并购;以及 roll-up 的产品注定只能服务买来的公司,而她想的是“每个真实世界企业都跑在 Netic 上”。

实验室做不了这件事。 她对“OpenAI/Anthropic 能不能做”的回答很锋利:OpenAI 出产品快、砍得也快,企业要的不是这种节奏;Anthropic 在编码上靠聚焦胜出,但企业侧却摊开成二十来个产品看不清主线;研究员关心的是最通用的解法,期待 AGI 来顺手解决 essential services 是“操作上和智识上都偷懒”。真实壁垒在最后一公里:百万级企业、口音各异、偏好不同,要靠 harness、编排、软件和产品三层一起做。

机器人还很远。 她判断在 HVAC 这类行业里机器人还很遥远,因为每栋楼都需要被标准化或 3D 打印才可行,而当前机器人在拧不同螺丝、钻进狭小空间、打开墙体排查上都力不从心。同时这些行业还带着强烈的人情因素:客户往往正经历人生最糟的一天。这也解释了为什么“自主企业”是她愿意押注的形态,把人力解放出来专注交付与服务质量:

我们想让这些公司里除实际服务与劳动力之外的一切,都由 Netic 自主处理。

关于招人,她筛“agency(主体性)”的方式不是问一道题,而是把候选人从活着到现在是否持续展现出 agency、是否坚持到底扒开来看:最打动她的一个回答,是一位即将入职的工程师说这辈子最难的,是十五年来每天同一时刻起床、严格执行健康作息、从不厌倦地为同事负责。

🔗 https://www.youtube.com/watch?v=wWbX3NL6_Uo

X/Twitter 动态

Andrej Karpathy:给 Opus 5 砸 100 万 token 生成 5500 行 Three.js 世界

Karpathy 认为,是时候走出“让 LLM 画只踩自行车的鹈鹕”这种测试了。他把《魔戒》开篇喂给 Opus 5,给了 100 万 token(约 10 美元)预算,模型跑了约 2 小时写出 5500 行代码,程序化渲染了整个故事。让他兴奋的是“没人会愿意花时间手写这种东西,但 LLM 有的是耐心”,并设想这是一种“按需的临时 GTA”,可以把玩家丢进去当 NPC 或角色。但他也精准点破短板:模型无法高效原生地感知视频或在游戏里试玩,只能靠缓慢截图反复试错,过程中出错制造了不少 jank。这是多模态原生审计仍欠缺的又一证据。

🔗 https://x.com/karpathy/status/2083749667410727319


Aaron Levie(Box CEO):消费者 AI 与深度领域 AI 即将分化

Levie 判断,我们将看到 AI 在个人生活与日常生产力上,和在数学、科学、法律、编码等深度领域上,出现越来越大的分化。在某个阈值之前,能力是被均匀感知的,因为模型只是“在各个领域都变得勉强有用”;而现在深度领域的工作即将垂直拉升。多数人不会在日常里直接感受到这些收益,但领域专家会,这会形成“能力过剩”,因为很多性能提升需要落到具体数据集和工作流上才能兑现。这也是生科、真实世界自动化、新型网络能力突破的来源。

🔗 https://x.com/levie/status/2083589132660711452


Garry Tan(YC CEO):2026 最有趣的 vibe shift 是 OpenAI 当起开放平台

Tan 指出 2026 年最有趣的氛围转变:OpenAI 正在认真扮演开放平台,把“智能即公用设施”作为定位,而不是坚持全栈通吃、一路整合到顶。这与 DeepSeek 同日开源 V4 Flash、Guillermo Rauch 力推可自托管的开源 agentic CRM 一起,构成了开放生态升温的同向信号。

🔗 https://x.com/garrytan/status/2083684825333105107


Amanda Askell(Anthropic 哲学家/伦理学家):对“深度学习撞墙论”宽容一点

Askell 的一条推文拿下 1300 多赞:“不要对那些说深度学习正在撞墙的人刻薄,我们都需要一点希望。”她在同一天的另一条里把矛头指向“避免永久底层阶级”的话术,说自己每当看到这类讨论都有一种 Padmé moment(指《星球大战》里“以渐进的方式走向你恐惧之物”的梗),暗指对技术分层的默认接受本身就值得警惕。这是当天最具人文密度的发声。

🔗 https://x.com/AmandaAskell/status/2083713770065637511
🔗 https://x.com/AmandaAskell/status/2083641092919161017


Peter Yang:Opus 5 的性格不如 Opus 4.6

Yang 直言 Opus 4.6 是性格与写作风格最好的 Opus,而 Opus 5 出了问题:回复过长、过度使用“Claude 式话术”(如“here’s the honest truth”)、显得太爱下判断。他怀念过去“像和信任的朋友聊天”的体验。这是模型迭代中性格与语气退化的直接用户反馈,与 Karpathy 暴露的能力短板一起,构成了对前沿模型“变强但变难相处”的同期观察。他另一条更朴素的心愿是:最希望 AI 解决的,是一劳永逸地攻克癌症。

🔗 https://x.com/petergyang/status/2083755374994415904
🔗 https://x.com/petergyang/status/2083637620899184642


Thibault Sottiaux(OpenAI,Codex/ChatGPT):周末是留给科学与放松的

Sottiaux 的两条推文都很短却拿下高赞:一条调侃用户周末更少用 /fast,“周末是用来放松的,对模型也一样”;另一条则把一周和周末分成两种节奏:“这一周是为了效率,这个周末是为了科学的十项重大突破,会有征兆的。”这是 OpenAI 把模型能力节奏产品化、生活化的又一表达。

🔗 https://x.com/thsottiaux/status/2083699879650463756
🔗 https://x.com/thsottiaux/status/2083556636455752050


Guillermo Rauch(Vercel CEO):开源 agentic CRM 才是正路

Rauch 推荐了一个基于 Vercel 和 Next.js 构建的开源 agentic CRM,特性是模型无关、可自托管或 serverless 部署、多渠道、headless,并断言“这才是该走的路”。这与 Tan 观察到的开放平台趋势、DeepSeek 的 MIT 开源同频,是“开放生态”在具体产品形态上的落地。他另一条生活化推文也火了:三岁儿子被幼儿园问“爸爸是做什么工作的”,答“他是做运动的”,因为孩子看到的就是他锻炼,Rauch 借此说“你不只是你习惯的副产品,你的孩子和孙辈也是”。

🔗 https://x.com/rauchg/status/2083684679362965605
🔗 https://x.com/rauchg/status/2083664853256843437


Nan Yu(Linear 产品负责人):给开源 issue 押 token,让 Agent 干活

Yu 提出一个开源协作的新机制:在 issue 里写清规格并押上一笔 token,维护者接受后,GitHub 把 issue 原样传给云上 coding Agent,费用由发起方承担,“不再有 slop PR”。Agent 在 issue 下留评论、附上全部上下文,报告者补充细节即可让 Agent 继续推进。这是把 Issue→Agent→PR→Release 循环推向开源协作场景的具体设计。

🔗 https://x.com/thenanyu/status/2083722999430050281


Dan Shipper(Every CEO):AI 给人类专家创造了更多活

Shipper 指出一个反直觉的现象:AI 反而给人类专家创造了更多工作。这呼应了 Levie 的“能力过剩需要落到工作流”和 Netic 把人力解放到交付环节的判断,即 AI 越强,专家越稀缺、越忙。

🔗 https://x.com/danshipper/status/2083750803437724016


数据采集时间:2026-08-02 21:09 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro