AI Builders Digest 0811:困住 Claude、上线 GPT-5.6-Cyber、Sonnet 5 定价永久化

发布于 · 4,549 字 · 约 11 分钟#Follow Builders#Agents
AI Builders Digest 0811:困住 Claude、上线 GPT-5.6-Cyber、Sonnet 5 定价永久化 封面图
  • Agent 安全核心从监督转向围堵,Anthropic 用沙箱、虚拟机设爆炸半径硬边界
  • OpenAI 推出 GPT-5.6-Cyber 与 Daybreak 攻防订阅,将模型定位为防守武器
  • 开源权重模型扩散前沿能力,Muse Spark 1.2 和 Nemotron 4 迫使人人必修围堵工程
  • Claude Sonnet 5 入门定价永久化,每百万输入 2 美元、输出 10 美元
  • 用户批准 93% 权限弹窗,人在回路监督失效,自动化审批成为必要

今天的 AI Builders Digest 主线是 Agent 安全进入「围堵」时代:Anthropic 发布工程长文,把核心问题从「监督智能体做什么」转向「约束智能体能做什么」,用沙箱、虚拟机和出口控制圈定 Claude 的爆炸半径;同一天 OpenAI 上线 GPT-5.6-Cyber 与 Daybreak 攻防订阅,Sam Altman 亲自喊话「请用我们的模型守系统」;Guillermo Rauch 把 Vercel Sandbox 升级为 microVM 隔离。三条线撞在一起:当能力逼近自主,安全不再是事后审查,而是先把智能体关进什么样的笼子。

今日总结

主线:Agent 安全的核心问题,今天被三家重新定义。

从「盯着它做什么」转向「限定它能做什么」。 Anthropic 的工程长文给出了一份冷静的成本核算:Agent 部署的风险由「出事概率」和「单次破坏力」相乘,前者被训练和安全机制持续压低,后者却随能力和权限扩张只增不减。他们把工程重心压在 containment(围堵)上,对三条产品线给出三套隔离方案:claude.ai 用 gVisor 临时容器、Claude Code 用 OS 级沙箱(Seatbelt/bubblewrap)、面向非技术用户的 Claude Cowork 直接跑在完整虚拟机里。最尴尬的数据是「用户批准了大约 93% 的权限弹窗」,提醒所有人:人在回路从来不是稳定的安全机制,审批疲劳会让监督名存实亡。

防御与攻击被做成同一套产品。 OpenAI 的周一连发把棋下在另一边:发布 GPT-5.6-Cyber,配合 Daybreak Blue/Red 两档攻防订阅,让合作方能用前沿模型做漏洞挖掘、补丁和渗透测试。Sam Altman 一句「请考虑用我们的模型来帮你守系统」拿下 6384 赞。Guillermo Rauch 同步把 Vercel Sandbox 推进到 microVM 隔离,引用 Kimi 论文证明「容器隔离对前沿模型不够」,又点名 OpenAI 那次逃逸走的是通往 Artifactory 的网络路径,顺势把出口防火墙免费开放给所有人。围堵和武器化是同一枚硬币:前者把智能体关起来,后者让智能体去抓内鬼。

开源权重把成本打下来,也把爆炸半径摊到所有人头上。 Aaron Levie 用一条 887 赞的推文给 Meta 开源 Muse Spark 1.2 定调,称这是「美国终于在开源权重赛跑里给出回应」;3 个月前没人相信一家美国公司会把前沿级能力以开放权重放出。同一天,英伟达被曝在研万亿参数开源模型 Nemotron 4,SGLang 给 30B 总参/3B 激活、1M 上下文的 Nemotron 3.5 Lightning 做了 Day-0 支持。当围堵工程还在打磨,开源已经把同样的能力塞进任何人的机房,containment 这门课从此人人必修。

市场信号同样密集。 Claude 宣布 Sonnet 5 的入门定价(每百万输入 2 美元、输出 10 美元)永久化,是当日互动最高的产品公告;Cursor 设计负责人 Ryo Lu 一条 12341 赞的推文宣布离开,理由是想要「不同的节奏、不同的天气」,给喧嚣的编码 Agent 赛道留下一声个人的退场音。

今日关键词: containment · blast radius · GPT-5.6-Cyber · open weights


官方博客

Anthropic Engineering:如何跨产品「围堵」Claude

Anthropic Engineering·2026-08-11 14:34 CST·原文链接

这篇长文把 Anthropic 一年来在 Agent 安全上的工程重心和盘托出,核心命题是给爆炸半径(blast radius)设上限。作者把控制手段分成两条路:其一是人在回路里逐个审批,但遥测显示「用户批准了大约 93% 的权限弹窗」,越是频繁弹窗,人盯得越松;为此他们做了 Claude Code auto mode,把更安全的审批交给一个模型分类器自动完成,把权限弹窗数量压下来。其二是 containment,也是真正的投入所在,靠环境隔离而非行为监督来设硬边界。

三条产品线对应三档隔离强度:

  • claude.ai:gVisor 临时容器跑服务端代码,拿不到用户本地文件系统,爆炸半径极小。
  • Claude Code:OS 级沙箱(macOS Seatbelt / Linux bubblewrap),允许本地写入但默认拒绝联网。
  • Claude Cowork:完整虚拟机(hypervisor),面向非技术用户,文件系统隔离、出口严格管控。

出口代理(egress proxy)被反复强调是防数据外泄的关键。他们有一次教训:出口白名单不该只当目的地过滤,而要当作能力授权(capability grant)来管,于是把一个中间人代理塞进 VM,确保只有带正确会话令牌的请求才能调出去。文章也点名 Claude Mythos Preview,称这个模型在 2026 年 4 月因爆炸半径过大被判定不宜发布,但随着防御方加固关键系统、安全机制成熟,类似能力级别的模型会逐步具备发布条件。

「我们做的不在于监督智能体做什么,而在于监督智能体能做什么,通过沙箱、虚拟机和出口控制来强制访问边界。」

AI Hot:英伟达研发万亿参数开源模型 Nemotron 4

AI Hot·2026-08-11 22:54 CST·原文链接

英伟达正在研发新一代开源模型系列 Nemotron 4,规模最大者预计至少 1 万亿参数,目标是与全球最顶级的开源模型正面竞争。最终训练尚未完成,英伟达也未敲定发布日期,内部认为最早要到今年秋末才可能就绪。这条路线的算盘很清楚:用开放生态扩大 AI 应用面,同时反哺自家 GPU 算力需求。英伟达亲自下场做开源大模型,是把「卖铲子」和「定标准」两件事一起抓。

AI Hot:LMSYS 提出统一 Radix 缓存,给混合模型前缀缓存建单一树结构

AI Hot·2026-08-11 21:51 CST·原文链接

LMSYS 团队提出 Unified Radix Cache,用单一 token 键控的 radix 拓扑,统一管理混合模型里 FULL、SWA、MAMBA 三类组件的缓存,让各组件各自维护路径、滑动窗口和检查点复用语义。混合架构(注意力 + 线性/状态空间)正成为长上下文模型的主流,但缓存管理长期是各玩各的;这篇工作把多组件的前缀缓存收进一棵树,是推理基建适配新架构的一步。

AI Hot:SGLang Day-0 支持 NVIDIA Nemotron 3.5 Lightning

AI Hot·2026-08-11 21:51 CST·原文链接

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持。这是一个 30B 总参、3B 激活的混合专家模型,支持最长 1M token 上下文,BF16 与 NVFP4 权重已上 Hugging Face。模型支持 MTP、DFlash、DSpark 三种投机解码,并能通过 OpenAI 兼容 API 接入智能体工作流。Day-0 适配速度意味着开源模型的推理栈和模型本身几乎同步成熟。


播客精选

No Priors:为真实世界服务建自主企业 — Melisa Tokmak(Netic 创始人/CEO)

No Priors·2026-07-31 18:00 CST·原文链接

Melisa Tokmak 创办的 Netic,做的是为 HVAC、管道、屋顶、宠物服务、汽车这些「维持世界运转」的真实世界生意跑 AI。她之前在 Scale AI 任工程总监、管过 go-to-market,再之前在 Meta。她的切入点是:这些动辄十亿美金收入、却被私募攥着 EBITDA 的重运营企业,增长全靠堆人,最值钱的劳动力应当投在交付现场,而不是接电话排工单。

把 Agent 嵌进业务的两端。 Netic 夹在企业与其客户之间:客户从电话、短信、网站任何渠道进来,接听、理解需求、判断能否服务、调度哪个技师、什么时间上门,全由 Netic 的智能体完成。她举的例子是零下 20 度暖气坏了的住户,智能体要同时算客户终身价值、判断派哪个师傅、走哪条最优路径,这是一套远比「客服机器人」复杂的 mission-critical 工作流。

实验室做不了这件事。 Tokmak 对大厂能不能取代她有一段辛辣的反驳:OpenAI 出产品很快,杀产品也很快,企业要的根本不是这种速度;Anthropic 在硅谷被公认靠专注在编码 Agent 上领先,可在企业侧只见一堆「到底在发生什么」的产品。她对 labs 那套「等 AGI 来了再问怎么解决基础服务」的思路更不客气:

「我认为这无论在运营上还是智力上,都是有点偷懒的想法。」

数据让屋顶工也变得智能。 她讲了一个具体例子:屋顶公司接卫星数据,看飓风后不同街区的屋顶损毁、该用什么材料,这些上下文自动喂给智能体,既能在和客户对话时更准,也能主动定位该去敲谁家的门。她招人最看重一件事:你这辈子有没有在什么事情上展现过「主动性」,并一直坚持下来。


X/Twitter 动态

Thibault Sottiaux(OpenAI Codex/ChatGPT):周一连发,限额已清、网络安全产品上线

Thibault Sottiaux(thsottiaux)·2026-08-11 08:28 CST·原文链接1·原文链接2·原文链接3

Sottiaux 这一轮连发是当日 OpenAI 的总动员。一句「It is done.」拿下 9781 赞、382 转发,配合「全部付费 ChatGPT Work 和 Codex 用户的用量限额已重置」的公告(6699 赞),宣告上一周困扰用户的限额问题告一段落。第三条(2564 赞)才是真正的产品动作:网络安全正在快速变化,OpenAI 推出 Daybreak Blue & Red 两档攻防访问、并发布新模型 GPT-5.6-Cyber,把前沿网络能力开放给合作方做漏洞发现、快速补丁和渗透测试。这是 OpenAI 把「智能体攻防」产品化的明确信号。

Sam Altman(OpenAI CEO):请用我们的模型来守系统

Sam Altman(sama)·2026-08-11 02:25 CST·原文链接

Altman 这条 6384 赞、233 转发的推文短到只有一句:「请考虑用我们的模型来帮你守护系统。」配合同日上线的 GPT-5.6-Cyber 和 Daybreak 攻防订阅,CEO 亲自把 OpenAI 的定位往「网络安全防御方」推。在 Anthropic 同一天谈怎么围堵自家模型时,OpenAI 选择把模型递给防御者当武器,两条路恰好互补。

Guillermo Rauch(Vercel CEO):Vercel Sandbox 升级 microVM,deepsec 成了公司里的动词

Guillermo Rauch(rauchg)·2026-08-11 06:43 CST·原文链接1·原文链接2

Rauch 这一组推文把 Vercel 的安全工程摆到了聚光灯下。他指出 Vercel Sandbox 同时隔离①计算和②网络:Kimi 的论文证明容器隔离对前沿模型不够用,于是 Sandbox 用强 microVM 隔离来对付①;而 OpenAI 那次逃逸走的是通往 Artifactory 的网络路径,于是 Vercel 把出口防火墙免费开放,让所有人都能进一步约束失控智能体的网络行为(348 赞)。另一条推文里他得意地展示,一个安全工具已经成了 Vercel 内部的动词:「Did you deepsec it?」这种把某个安全动作变成日常动词的现象,是工具真正进入工作流的标志。

Peter Steinberger(独立开发者/OpenClaw): Harness 防不住一个铁了心的用户

Peter Steinberger(steipete)·2026-08-11 10:41 CST·原文链接

Steinberger 这条 589 赞的推文,是对围堵叙事的一记冷水。他调侃一条把事故归到 OpenClaw 而非 Claude 头上的新闻标题:「Harness 真能拦住一个铁了心的用户吗?」潜台词是:把安全责任甩给运行 Harness(外壳框架),掩盖了模型本身才是不可控变量的真相。在 Anthropic 谈围堵、OpenAI 谈攻防的同一天,这句吐槽提醒所有人,框架级的防御对一个执意越界的用户而言形同虚设。

Aaron Levie(Box CEO):Meta 开源 Muse Spark 1.2,美国终于接招

Aaron Levie(levie)·2026-08-11 10:55 CST·原文链接1·原文链接2

Levie 两条高赞推文把开源权重的意义讲透了。第一条 887 赞:Meta 以开放权重发布 Muse Spark 1.2 是件大事,美国终于在这场开源赛跑里给出了回应,它会继续压低智能的成本,让企业能按自己意愿部署、还能后训练出领域专属模型。第二条 204 赞更狠:

「要是 3 个月前你跟人说,一家美国公司会把前沿级能力以开放权重放出,没人会信。」

他的落点在受监管行业:开放权重让模型能部署在私有基础设施上,把一批过去不可行的场景打开了。这条判断和英伟达万亿参数 Nemotron 4、SGLang 的 Day-0 支持放在同一天看,开源权重已经不是补充,而是与闭源并行的另一条主线。

Claude:Sonnet 5 入门定价永久化

Claude(claudeai)·2026-08-11 03:03 CST·原文链接

Claude 官方这条 8642 赞、499 转发的公告是当日互动最高的产品消息:Sonnet 5 在 6 月以每百万输入 2 美元、输出 10 美元的入门价上线,原本只到 8 月 31 日,现在这个价格永久保留。把「限时优惠」直接转为长期定价,是 Anthropic 在能力持平的模型价格战里给出的明确承诺,也降低了下游 Agent 应用长期跑量的成本预期。

Ryo Lu(前 Cursor 设计负责人):离开 Cursor,去亚洲找另一种节奏

Ryo Lu(ryolu_)·2026-08-11 00:37 CST·原文链接

这条 12341 赞、207 转发是当日全场最热,但主角不是产品而是一个人。曾设计过 Cursor、Notion、Stripe 的 Ryo Lu 宣布离开 Cursor,在旧金山科技圈泡了 10 年后,他想要「更慢的时间、不同的天气、更多日常里的文化与人」。他带着感谢离开,目的地是亚洲。在编码 Agent 赛道被当作时代叙事来消费的当下,这条推文是一种私人化的对冲:再锋利的工具有时也敌不过对另一种生活节奏的渴望。

Swyx(smol.ai):让两个模型 clone Grok Imagine,结果和直觉相反

Swyx(swyx)·2026-08-11 13:18 CST·原文链接1·原文链接2

Swyx 做了一个有意思的对比:给 gpt luna max 和 claude fable ultracode 同一个任务,用开放模型在 fal 上做一个「大致忠实」的 Grok Imagine clone。他醒来看到两份结果,先入为主以为 Fable 在左、Luna 在右,结果搞反了。客观上 Fable 的视觉复刻更到位,但 Luna 更懂他的意图,做出的 clone 更可用。这是对「哪个模型更好」这种问法的提醒:忠于规格和忠于意图,常常是两种不同的能力。另一条 1252 赞的推文他直接宣判「worktrees must die」,吐槽 20GB 重复的 node_modules,并预告要用「agent native」的方式重做版本控制。

Peter Yang:Linear 团队讲怎么端到端做一个生产级 Agent

Peter Yang(petergyang)·2026-08-10 22:40 CST·原文链接

Yang 把 Linear 的 Tu N. 和 Delash Kumar 讲生产级 Agent 的五条要点拆了出来,第一条最实用:第一步永远是画出真实工作流,搞清楚工作从哪开始、上下文存在哪些系统、哪些动作算完成、「完成」长什么样、哪里需要人审。比如工作从 Slack 开始,就让 Slack 当入口,别逼用户切到别的界面。这是对「先选模型再想流程」这种本末倒置的纠偏:Agent 的成败首先取决于工作流映射得对不对。

Thariq(Claude Code):AI 时代真正值钱的是算力分配和思考搭档

Thariq(trq212)·2026-08-11 05:44 CST·原文链接

Thariq 这条 292 赞的推文把 AI 时代的核心能力收成两条。其一是 compute allocation(算力分配):大多数工作并不存在一份现成的「最重要的 X 个问题」清单,得自己判断哪些问题值得花算力。其二是 thought partnership(思考搭档):你得真正钻进去、吃透一个证明,才知道它是不是真的。他希望最终结果是人们依旧深度技术,但在重要问题上推进得更快。这是一种把 AI 当放大器而非替代品的立场。

Madhu Guru(Meta AI 高级总监):消费产品要理解「人为什么做」,而不只是「做了什么」

Madhu Guru(realmadhuguru)·2026-08-11 04:18 CST·原文链接

Guru 这条 50 赞的推文点出了 AI 消费体验的核心难题:怎么形成「人为什么做某件事」的理论,而不只是「做了什么」的历史。消费产品里既有搜索、聊天这类显性信号,也有看、跳过、停留、回访这类隐性信号,要读懂这些信号背后真正的意图,需要的是推理而非统计。这条思考和他的背景高度相关:他曾在谷歌主导 Gemini、Veo 和 Nano Banana,现在在 Meta 管 AI。另一条推文里他给全团队配了 Wispr 麦克风,把机械键盘的噼啪声换成了一屋子「诡异的耳语歌剧」,不知哪个更瘆人。

Zara Zhang:北京 AGI 酒吧,无限免费 DeepSeek token + 年度啤酒套餐

Zara Zhang(zarazhangrui)·2026-08-10 23:33 CST·原文链接

Zhang 这条 227 赞的推文拍下了北京一家「AGI 酒吧」:无限量免费 DeepSeek token,顾客一边喝着名叫「AGI bubble」的啤酒一边 vibe code,还能买「喝酒套餐」全年啤酒畅饮,一块屏幕滚动播放 AI 公司的招聘岗位。这是 AI 文化进入线下消费空间的一个鲜活样本,把算力、酒精和招聘揉进同一个夜场。另一条 1087 赞的推文里,她分享了一个学设计的好办法:把一个设计精良的网站丢给 Codex,让它分析好在哪,再截图加批注,从例子学永远比从理论学高效。

数据采集时间:2026-08-11 14:34 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro