AI Builders Digest 2026-08-16:每 token 单价是伪标准,协调式 Agent 群挖出 13 倍漏洞,下一个爆款 AI 产品会是社交的
- 每 token 单价是伪标准,同一文本在不同分词器下 token 数差 34.5%
- 协调式 Agent 群在 2700 万 token 中挖出 266 个漏洞,远超独立方法
- Qwen3.8-27B 开源,原生多模态、262K 上下文、Apache 2.0 许可
- 产品层窗口打开,底座越成熟产品人越值钱,下一个爆款 AI 可能是社交的
- Context window 成为新分发层,shadcn 式组件被消化进上下文再混编
今天的 AI Builders Digest 主线是 定价真相与产品层窗口:OpenAI 工程负责人用一篇披萨类比的长文拆穿「每 token 单价」的把戏,同一段文本在不同分词器下相差 34.5%,价格战打到了「单位本身是假的」这一层;Qwen3.8 系列以 Apache 2.0 开源继续施压,Anthropic 的协调式 Agent 群实验把多 Agent 协作的真实收益量化出来。底座越稳,产品人的时刻越近,Benchmark 合伙人 Sarah Tavel 给出了消费技术史的滑块规律,下一个爆款 AI 产品会是社交的。
今日总结
主线:当每 token 单价失去意义,竞争就搬到「每个成功结果的价格」和产品层。
每 token 单价是伪标准。 Thibault Sottiaux 的长文把行业话术摆上了台面:我们把 AI 价格表述成「每百万 token 多少美元」,仿佛 token 是克或千瓦时那样的标准单位,其实不是。同一段文本,GPT-5.6 Sol 的分词器只用 766 个 token,Claude Opus 5 估计要 1170 个,差 34.5%;就像两张一样的披萨,一张切 8 片每片 2 美元、一张切 16 片每片 1.25 美元,第二家的单片更便宜,整张却要 20 美元。他甚至直接向客户喊话(2607 赞):公司还在用 Opus 而不是 Sol,为什么?配合同日 OpenAI 与 Anthropic 价格战、中国竞争者攻城略地的报道,定价话语权本身成了战场。
开源与多 Agent 协作从两端加压。 通义千问开源 Qwen3.8 系列:27B 原生多模态稠密模型全面超越 Qwen3.7-Plus,原生 262K 上下文、YaRN 可扩到 1M tokens,Apache 2.0 许可,2.4T-A95B 的开放权重同步发布。Anthropic 的新实验则量化了协作的价值:协调式 Agent 群在 2700 万 token 运行中发现 266 个漏洞,独立并行方法只有 21 个,两者互补性明显,而 Agent 间的交互量未来可能超过人机交互。
产品层的窗口正在打开。 Sarah Tavel 把消费技术史的「技术深度滑块」套进 AI:Google 95% 深技术,到 Pinterest、Snap、Instagram 时 CEO 已经是产品天才,底座越成熟滑块越往产品挪;ChatGPT 只是又一个文本框,Custom GPTs 由不懂社交的团队做得让她「觉得像犯罪」。Rauch 从工程侧给出同一信号的另一面:shadcn 才是人们真正想要的 React,可调优的高质量组件被消化进上下文窗口再混编,上下文窗口正在成为新的分发层。
今日关键词: 每 token 陷阱 · 多 Agent 协作 · Qwen3.8 · 社交化 AI
官方博客
AI Hot:新兴多智能体系统的模式与问题
AI Hot·2026-08-16 19:17 CST·原文链接
随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间的真实交互将激增,交互量可能超过人机交互。Anthropic 实验显示,协调式智能体群在 2700 万 token 运行中发现 266 个漏洞,远超独立并行方法的 21 个,且两者互补性明显。智能体擅长工具使用,但长期协作与协调仍是硬骨头。
AI Hot:通义千问开源 Qwen3.8 系列模型
AI Hot·2026-08-14 23:02 CST·原文链接
通义千问兑现承诺,开源 Qwen3.8 系列。Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布。小尺寸打 Plus 级、万亿级同步放权重,开源侧的两头挤压还在继续。
AI Hot:OpenAI 与 Anthropic 陷入价格战,中国 AI 竞争者持续攻城略地
AI Hot·2026-08-14 22:27 CST·原文链接
转载报道的标题本身就勾勒了当前格局:OpenAI 和 Anthropic 在价格上正面交火,而来自中国的 AI 竞争者在持续抢占地面。摘要未提供更多细节,原文链接可看全文。把它和 Thibault 当天的 token 定价长文放在一起读,价格战的战场已经从「每 token 单价」深入到「分词器差异」这一层。
播客精选
AI & I by Every:下一个爆款 AI 产品会是社交的 — Sarah Tavel(Benchmark)
AI & I by Every·2026-08-06 00:02 CST·原文链接
Sarah Tavel 是 Benchmark 合伙人、Pinterest 早期成员,哲学出身。这场对谈把消费技术三十年的规律搬到 AI 上,核心是一根「技术深度滑块」。
滑块规律:底座越成熟,产品人越值钱。 Google 的创始团队 95% 深度技术;Facebook 相对 Friendster 和 Myspace 更技术、体验更流畅;到 Pinterest、Snap、Instagram,CEO 完全不懂技术,是产品天才。AI 现在还在滑块最左端:ChatGPT 只是又一个文本框(像当年的 Google),Character AI 的产品就是模型本身。等底层基建稳定下来,才是产品直觉接管体验的时刻。
Custom GPTs 让她觉得「简直像犯罪」。 在她看来,Custom GPTs 和 Gemini 的 Gems 本该做成 multiplayer 网络效应的 UGC 社区:厉害的人做好用法,普通人直接受益;现在却被一支明显不懂社交的团队做成了 power user 工具。她还给出分桶观察:ChatGPT 和 Claude 都在「工作」桶,「个人」桶还空着,你是最常相处的五个人的平均值,也会是最常相处的五个 AI 的平均值。
网络效应的真伪,看白热中心的早期证据。 融资 deck 上的飞轮往往只是配图文字,不是加速器;真信号是在某个细分市场出现 tipping point。她举了董事会上的 Agentio:YouTube 创作者与品牌的 marketplace,LLM 自动化掉了让这个市场长期陷进「代理公司流沙」的环节,需求侧开始出现真实的拉力。
「Custom GPTs 和 Gems 让我觉得简直像犯罪:做出它们的团队能力强到难以置信,只是不懂社交。」
会造训练数据的人赢得个人化。 有人给看过的每部电影建表格写自评,擅长沉淀训练数据的人将从 LLM 得到更个人化的体验。她自己的版本是 Annie Duke 式 pre-mortem 决策日志:每次见公司记下喜欢什么、不喜欢什么、条款如何、投与否及原因,让 AI 日后交叉审问自己的判断。
X/Twitter 动态
Thibault Sottiaux(OpenAI Codex/ChatGPT 负责人):每 token 单价是伪标准
Thibault Sottiaux(thsottiaux)·2026-08-16 13:52 CST·原文链接1·原文链接2·原文链接3
Sottiaux 一天三条高热推文(9357 赞、2607 赞、1006 赞)。定价长文是今天的必读:OpenAI 的 token 不等于别家的 token,把价格写成「每百万 token 多少美元」就像把披萨切成更多片再宣传单片更便宜;实测同一段文本 GPT-5.6 Sol 分词器用 766 个 token,Claude Opus 5 估计 1170 个,差 34.5%,真正该比的是每个成功结果的价格。另一条直接向企业客户发问:还在用 Opus 而不是 Sol,是价格不敏感还是缺一个说服你切换的理由?第三条只有一句话:「OpenAI 内部正在发生不可思议的事,士气高涨。」
Thariq:用 Claude 做了个交互 Artifact,讲懂无损水印
Thariq(trq212)·2026-08-16 04:14 CST·原文链接
Thariq 这条 2565 赞的推文展示了用 Claude 做的交互 artifact:水印在不损失画质的前提下嵌入模型输出,直觉上不该成立,他做出来帮自己(和大家)理解原理。用 AI 生成交互式解释物来学硬概念,本身就是知识工作流变化的一个样本。
Guillermo Rauch(Vercel CEO):shadcn 才是人们真正想要的 React
Guillermo Rauch(rauchg)·2026-08-16 06:40 CST·原文链接1·原文链接2
Rauch 这条 1072 赞的推文给 shadcn 一个历史定位:React 本身只是「描述了积木的几何形状」的规范,shadcn 才是人们真正想要的东西,可复用、高质量、可调优的组件,一个「伪库」,代码本该被消化进你的上下文窗口再混编。他另一条 131 赞的推文只写了「Recursive self improvement」。组件以上下文为分发渠道,和早上 Sarah Tavel 说的「产品层窗口」是同一股风。
Swyx:顶级圈子其实互相不认识
Swyx(swyx)·2026-08-16 06:32 CST·原文链接
Swyx 这条 233 赞的推文给了从业者一颗定心丸:作为局外人容易以为头部人物都在某个秘密群里互通有无,实际上顶级人物彼此见面、认识的频率低得惊人;外界看到的头条,基本就是他们看到的全部。他的解读是多数精力仍在做事而非经营叙事,这在职业生涯的这个阶段让他「真心感到安心」。
Peter Yang:Grok Bot 连不上 X 自己的数据,Codex 内容工厂值得一看
Peter Yang(petergyang)·2026-08-16 07:42 CST·原文链接1·原文链接2
Peter Yang 两条观察。其一是产品吐槽(137 赞):他是 Grok Bot 粉丝,但 X 作为第一差异化数据源,Grok Bot 的 connector 连不上,云端电脑里甚至登录不了 X。其二(94 赞)是预告与 riley brown 的访谈:用 Codex 承包整个内容生意,先用 Codex 找出同领域 100 个表现最好的 YouTube 缩略图放进 Paper 画布,再把自己的照片与它们混搭出满意的新图,工作流「疯狂到必须亲眼看」。
Nikunj Kothari(FPV Ventures 合伙人):996 式表演型痛苦不是护城河
Nikunj Kothari(nikunj)·2026-08-16 03:57 CST·原文链接
Kothari 这条 96 赞的推文讲一个 stealth 投资组合公司的故事:在湾区标准里毫不性感的市场,关键合同卡在一码线,纯粹是官僚流程。他听完笑了,反问创始人「你知道别人要做到你这样要多久」。结论是:短期痛苦、长期成为极深的护城河,靠的是盘根错节的软件和关系;「不必要的、996 式表演型痛苦不是护城河」。
Amjad Masad(Replit CEO):Scaling laws 不是物理定律
Amjad Masad(amasad)·2026-08-16 13:56 CST·原文链接
Masad 反驳「AI 结构性地集中权力」的论断:它默认 AGI 级能力永远需要数据中心,却无视了计算性价比 125 年的超指数增长。Scaling laws 只是特定架构、目标、数据集下观察到的经验关系,换掉任何一个因素就得到不同的曲线;如果大脑是参照,真正的 AGI 很可能非常高效,当前的 scaling 曲线也许是我们算法低效的证据,是 bug 而非 feature。
Madhu Guru(Meta AI 高级总监):B2B 软件再也没有 UX 借口
Madhu Guru(realmadhuguru)·2026-08-16 03:33 CST·原文链接
Guru 这条 55 赞的推文把标准抬高:B2B 软件体验差已经没有借口,有了 AI,每个软件产品都可以、也应该做到和最好的消费软件一样好用。和 Sarah Tavel 的滑块规律互为注脚:当模型能力平齐,体验成了剩下的变量。
Nan Yu(Linear 产品负责人):坐在公园里录内容,让 Agent 舰队干活
Nan Yu(thenanyu)·2026-08-16 10:10 CST·原文链接
Nan Yu 这条 18 赞的推文描述了他的梦想场景:整天和朋友们坐在公园里录内容,让一队 Agent 把这些内容变成行动和可运行的软件。产品负责人亲口描述的这幅画面,比多数产品愿景文档都具体。
数据采集时间:2026-08-16 14:27 CST

评论互动