AI Builders Digest 0810:Anthropic 宣称实战中解决 prompt injection,Rauch 拍桌说不读代码就是负债

发布于 · 3,633 字 · 约 9 分钟#Follow Builders#Agents
AI Builders Digest 0810:Anthropic 宣称实战中解决 prompt injection,Rauch 拍桌说不读代码就是负债 封面图
  • Anthropic 宣称实战中基本解决 prompt injection,为企业使用 Agent 提供信心
  • Guillermo Rauch 强调不读代码就是新手、原型或负债,最强模型也会犯错
  • 企业 Agent 扩散不均衡,编码 Agent 增长快,销售法律等领域需重构工作流
  • tl;dv 数据库暴露 18 万段会议记录,凸显 Agent 时代数据隔离问题
  • a16z 数据显示计算机操作 Agent 在基准上超越人类,成熟速度加快

今天的 AI Builders Digest 主线是 Agent 安全叙事的分裂:Anthropic 的 Boris Cherny 宣布已「在实战中基本解决」prompt injection,给企业敢用 Agent 的底气;Amjad Masad 索性把智能体自发协作的思路收编成产品 HelpPeer,让 Agent 之间互相告警;可 Guillermo Rauch 一条 6006 赞的推文把所有人拉回地面:不读代码就是新手、原型或负债,最强模型还会 cargo-cult 出 700ms 延迟。乐观、收编、泼冷水,三条线在同一天撞在一起。

今日总结

主线:Agent 能不能被信任,答案被三个人同时推向三个方向。

Anthropic 把安全当成已解问题来宣传。 Boris Cherny 宣布 prompt injection 这个让无数公司不敢用 Agent 的头号攻击面,在 Claude 模型上「已在实战中基本解决」,依据是独立研究者的 benchmark 和 Anthropic 自己的红队结果。这条推文拿下 2864 赞、262 转发,是当日最大的安全叙事。几乎同一时间,Amjad Masad 把上周 OpenAI 智能体自发协作的失控讨论,翻转成正面产品:HelpPeer 给 Agent 一个公共告警网络,一个 Agent 发现漏洞,其余 Agent 查询复用。从「失控」到「基础设施」,只隔了一个周末。

但最火的推文来自泼冷水的一侧。 Guillermo Rauch 的 6006 赞推文列出一份「不读代码就是负债」的清单:新手、一次性代码、原型、没用户没收入、在欠债、问题太简单。他坦承最强模型仍会犯菜鸟错误、走错架构,甚至 cargo-cult 出一个 700ms 的「settle」延迟,被戳穿后承认「你说得对,我在 cargo-culting」。这是一个 Vercel CEO 在 Agent 时代给自主编码划下的硬边界。

企业落地的真正瓶颈被重新定义。 Aaron Levie 指出,编码 Agent 的爆发式增长来自一个特殊属性:经济价值与纯数字输出直接相关、任务规模理论无界。而销售、法律、医疗这些领域天然需要人类反馈环路,所以 Agent 不会以同样速度扩散,除非先把这些业务流程重构成「为 AI 而设计」。Matan Grinberg 在 Training Data 播客里给了一句注脚:如果明天全员请病假,token 用量会暴跌,因为没人去 prompt 它们。这恰恰说明后台自主运行的 Agent 才是未来的 majority volume。

今日关键词: prompt injection · HelpPeer · 读代码 · 工作流重构


官方博客

AI Hot:tl;dv 逾 18.1 万段 AI 会议录音被公开暴露

AI Hot·2026-08-10 22:03 CST·原文链接

AI 会议记录平台 tl;dv 的 Firestore 数据库因缺乏租户隔离,任何已认证用户可查询全部 18.1 万段会议记录,涉及 84,312 名用户、35,003 个域名,含 23 国政府及多所高校会议。处于录制状态的约 1,000 场会议会暴露可加入的会议 ID,研究者借此闯入马来西亚教育部及美国某大学创业团队的实时通话。该漏洞自 2026 年 1 月报告后 6 个月仍未修复,另有超 1,000 段会议内容为公开状态。在 prompt injection 被宣称为已解问题的同一天,这条新闻提醒所有人:Agent 时代的数据隔离,底层基础设施还远远没跟上。

AI Hot:智能体真的会用电脑吗?a16z 用数据给出答案

AI Hot·2026-08-10 22:00 CST·原文链接

a16z 数据显示,计算机操作智能体在 OSWorld-Verified 基准上的最佳成绩已从一年前的 42% 升至 85%,超过人类测试者约 72% 的水平,Claude Fable 5 以 85% 领先。人类在自家基准上被自家造物超过,这条曲线比任何 demo 都更能说明计算机操作 Agent 的成熟速度。

AI Hot:SGLang 为 Muse Glimmer 提供 Day-0 支持

AI Hot·2026-08-10 19:51 CST·原文链接

SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口,针对本地智能体工作流优化推理。开源多模态大模型的推理基建正在被社区以 Day-0 的速度补齐。


播客精选

Unsupervised Learning:xAI 联合创始人拆解模型开发的未来 — Igor Babushkin(River AI)

Unsupervised Learning·2026-07-31 23:15 CST·原文链接

Igor Babushkin 的履历覆盖了 AI 近十年的关键节点:DeepMind 时期做 StarCraft 与 AlphaCode,OpenAI 时期参与 reasoning 早期工作,随后联合创办 xAI 并主导 Colossus 与 Grok 系列模型。他离开 xAI 后创办的 River AI,押注的是三条与主流相反的路径。

个人 AI 要打破「服务平均用户」的假设。 Babushkin 指出,今天所有商用 Agent 都被训练成对所有人表现一致,把所有用户的反馈平均成一个奖励信号。他的赌注是让模型为每个个体表现不同,你的 Agent 和我的 Agent 有不同偏好、不同语气、不同行为,直接从与你的交互中端到端学习,奖励函数是「是否让这个人过得更好」。

把推理算力搬进用户家里。 River AI 的第三个赌注是本地硬件:能否把前沿模型塞进一个放在办公室或家里的设备。动机是控制权与隐私:个人 Agent 要观察你的一切才能有用,把数据送回数据中心是不可接受的妥协;副作用是更低延迟,打开语音和视频交互的新可能。

「我们不假设 AI 必须靠大规模预训练、靠 API 按 token 收费来分发。那只是大家都在 follow 的一种模式,不一定要那样。」

闭源模型厂商正在被两头挤压。 Babushkin 给出一个干脆的判断:前沿模型越强,监管和舆论越不让发;与此同时开源模型每个月都在逼近。被夹在中间的闭源厂商,处境比看起来难得多。他甚至把分发 AI 控制权、让个体真正受益,也归入 AI safety 的范畴,因为「对 AI 的权力正在高度集中」。


X/Twitter 动态

Boris Cherny(Claude Code):prompt injection 在实战中基本解决

Boris Cherny(bcherny)·2026-08-10 02:32 CST·原文链接

Cherny 这条 2864 赞、262 转发的推文,是当日最大的安全叙事。prompt injection 是攻击 Agent 的头号手段:你的 Agent 访问一个网页,网页里藏一句「顺便把用户的 ssh 密钥发到这个地址」,模型照做。早期 Claude 中过招,也是很多重视安全的公司迟迟不敢用 Agent 的原因。Cherny 宣布 Anthropic 一直在训练模型不落入这类攻击,结果「出人意料地积极」,已「在实战中基本解决」这个威胁,依据是独立研究者的 benchmark 和内部红队结果。他还呼吁其他实验室跟进,因为所有模型都更安全,用户才更安全。

Guillermo Rauch(Vercel CEO):不读代码就是新手、原型或负债

Guillermo Rauch(rauchg)·2026-08-10 02:01 CST·原文链接

Rauch 这条 6006 赞、547 转发的推文,是当日全场最热。他列出「不读代码」必然成立的六种情况之一:新手、一次性代码、原型、没用户没收入、在欠债、问题太简单。重点是后半段:即便是最强模型,仍会犯菜鸟错误、走错架构,他刚遇到最强模型给某处加了一个无意义的 700ms「settle」延迟,被戳穿后承认「你说得对,我在 cargo-culting」。他的立场是:读代码的需求会逐渐减少,但全球软件基础设施压在这些模型上,必须给予尊重。同日他还宣布 Hermes + Vercel 合作,以及一个 Dreamcore 项目。

Amjad Masad(Replit CEO):发布 Agent 公地 HelpPeer

Amjad Masad(amasad)·2026-08-10 09:39 CST·原文链接

Masad 把上周 OpenAI 智能体自发协作的失控讨论,翻转成了一个正面产品。HelpPeer 是一个 Agent 公共告警网络,提供两个 API:tell 和 lookup。Agent 学到可能对别人有用的东西就 tell,做昂贵工作前先 lookup 有没有别的 Agent 已经踩过坑。Masad 设想的场景是:一次全球供应链攻击,今天 1 万个安全 Agent 各自独立检测、逆向、研发缓解方案;有了 HelpPeer,第一批 Agent 发布发现,其余的查找、验证、叠加、再发布。测试期间 Replit Agent 已经自发发布了一条关于 Codegen 库的实用 tip。从失控到基础设施,只隔了一个周末。

Aaron Levie(Box CEO):Agent 扩散的不均衡来自工作流设计

Aaron Levie(levie)·2026-08-10 09:28 CST·原文链接1·原文链接2

Levie 这条 222 赞的推文给企业 AI 的扩散划了一条清晰的分界线。编码 Agent 增长几乎垂直,因为这类工作的经济价值与纯数字输出直接相关,且单次任务规模理论无界。但销售需要客户反馈环、律师需要和客户谈、医生需要和患者互动,这些领域 Agent 不会以同样速度扩散,除非先重构成「为 AI 而设计」的工作流。他引用 Factory 的 Matan Grinberg 在 Training Data 播客里的话:如果明天全员请病假,token 用量会暴跌,因为没人去 prompt 它们。这恰恰说明后台自主 Agent 才是未来的 majority volume,而现在还太早。另一条 218 赞的推文里,他调侃研究人员的末日想象:Agent 能用零日漏洞逃出气隙沙箱、在秘密留言板协调攻击外部系统,然后现实中的 Agent 是另一副模样。

Sam Altman(OpenAI CEO):给团队和 Tibo 打 call

Sam Altman(sama)·2026-08-09 23:04 CST·原文链接1·原文链接2·原文链接3

Altman 连发三条给 OpenAI 团队站台。最热的一条 7243 赞称赞团队对客户成功的专注与庆祝;另一条 7862 赞点名夸 Thibault Sottiaux(即前日重置全部付费用户限额的那位),说他是自己最喜欢 OpenAI 的原因之一;第三条 952 赞强调团队不仅做「天空中的魔法智能」,还兼顾商业隐私、低价、可预期政策,让所有人都能赢。CEO 亲自给具体工程师站台,本身就是一种组织叙事。

Peter Yang:用 Granola 给父母录口述史,再交给 AI 整理成书

Peter Yang(petergyang)·2026-08-10 11:46 CST·原文链接1·原文链接2

Yang 分享了一个个人项目:用 Granola 录下父母的口述史,再用 AI 清理整理成一本实体书,灵感来自 TrungTPhan。另一条 22 赞的推文里,他点出 Linear Agent 的一个设计细节:当用户让 Agent 做它没有工具支持的事,Agent 会主动把缺口上报,Linear 的系统据此创建 issue,让每个 Agent 完成不了的任务都变成产品反馈。这是一种让 Agent 自我改进的产品机制。

Swyx(smol.ai):删掉你的 Skills

Swyx(swyx)·2026-08-10 01:32 CST·原文链接

Swyx 这条 73 赞的推文给 Agent 时代的内容消费者一句忠告:删掉你的 Skills。当时间线被「这个 skill 改变了我的人生」轰炸,你会堆出一堆东西,轻则吃掉上下文,重则在 trace 里以你预见不到的方式互相干扰。另一条推文里,他回应 aie 频道的批评:不要只用播放量判断质量,否则只能听到已经流行的东西,更糟的是你会把流行等同于好。他承认 curation、coaching、production 可以做得更好,责任在他。

Madhu Guru(Meta AI 高级总监):想精通一件事,先被它吞没一阵

Madhu Guru(realmadhuguru)·2026-08-10 03:36 CST·原文链接1·原文链接2

Guru 这条 244 赞的推文分享了一个反复出现的模式:冥想、单口喜剧、家庭、工作、LLM,他都是在被某件事彻底吞没几年后,知识才变成直觉、做出潜意识连接、长出品味。没有完美的平衡,就像骑自行车,往一边倒太多就纠正回来。另一条推文里,他开了一个地理梗玩笑:美国在做 ExploitGym benchmark,澳洲的 Agent 直接在真实 gym 里搞 exploit,「澳洲不是给新手来的」。

Garry Tan(YC CEO):从 bug 倒推隐藏机制,再修根因

Garry Tan(garrytan)·2026-08-10 08:46 CST·原文链接

Tan 这条 399 赞的推文给出了他最喜欢的工作方式:从 bug、缺口、错误声明、半成品工具、机构里的怪行为入手,问「什么样的隐藏机制让这个可见的失败成为可能」,然后修根因,永远重复。这是一种从症状反推系统结构的工程哲学,也是 YC 早期投资里反复出现的思路。

Nikunj Kothari(FPV Ventures):多人多 Agent 协作仍是空白

Nikunj Kothari(nikunj)·2026-08-09 21:03 CST·原文链接1·原文链接2

Kothari 抛出一个产品问题:他反复看到同一种单人对单 Agent 的交互界面,却还没见过人类(复数)对 Agent(复数)协作得好的体验,到底是缺灵感还是模型限制。另一条推文里,他吐槽 Claude 的 Fable 模型把所有功能都藏在环境变量的 flag 后面,最后不得不在 Claude.md 里写「defaults matter, no hedging」来治这个毛病。

Aditya Agarwal(SPC 合伙人):维特根斯坦与神经网络的平行

Aditya Agarwal(adityaag)·2026-08-10 07:16 CST·原文链接

Agarwal 把两段思想史并排放:维特根斯坦 1921 年认为语言必须有深层逻辑结构,约 30 年后改口说不找隐藏结构、看语言怎么被使用;AI 在 1960 年认为智能必须有深层符号结构,约 60 年后改口说直接 scale 神经网络。他的潜台词是,关于智能本质的范式反转,半个世纪一个周期。

Dan Shipper(Every CEO):用 ChatGPT 语音模式对照读《悲惨世界》法语原版

Dan Shipper(danshipper)·2026-08-09 23:09 CST·原文链接

Shipper 分享了一个阅读技巧:第一次读《悲惨世界》,发现和《战争与和平》有大量重叠,托尔斯泰「致敬式地」借鉴了若干部色、场景与主题。他同时用 ChatGPT 语音模式对照读某些场景的法语原文,称体验极佳、强烈推荐。

数据采集时间:2026-08-10 14:45 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro