AI Builders Digest 0923:Opus 5.5 对阵 GPT-6 Sol 与 Luna,API 永久半价,Jevons 悖论降临 agent

发布于 · 2,887 字 · 约 7 分钟#Follow Builders#Models
AI Builders Digest 0923:Opus 5.5 对阵 GPT-6 Sol 与 Luna,API 永久半价,Jevons 悖论降临 agent 封面图
  • GPT-6 Sol 与 Luna 发布并永久降价 API 50%,Plus/Pro/Business 全量账户加载 banked reset(23309 赞)
  • Claude Opus 5.5 成为 Claude Code 与 Claude 应用默认模型,限额多跑 25%;Cherny 实测其 9.5 小时完成 HAProxy C 转 Rust、比 Fable 5.1 快 2.5 小时且省 51%
  • Cherny 用 Opus 5.5 对 Claude Agent SDK 做 Lean 形式化验证,几个短 prompt 产出 16 个修复 bug 与竞态的 PR
  • Levie 称同口径单任务成本下降速度史上未见,这是应用于 agent 的 Jevons 悖论;Box 实测 Opus 5.5 少用 63% token、快 30%
  • Rauch 的 Next.js evals:GPT 6 Sol 90%、Opus 5.5 与 Fable 5.1 各 87%、Grok 4.7 得 64% 但便宜 2 到 7 倍;Astra 找出 libuv 约 14 年的 bug

今天的 AI Builders Digest 主线是 双旗舰半价日:OpenAI 发布 GPT-6 Sol 与 Luna,全线显著提升之外 API 永久降价 50%,还给 Plus、Pro、Business 所有账户加载 banked reset(23309 赞);Anthropic 同日把 Claude Opus 5.5 设为 Claude Code 与 Claude 应用的默认模型,限额多跑 25%,Boris Cherny 实测它 9.5 小时把 HAProxy 从 C 移植到 Rust,比 Fable 5.1 快 2.5 小时还便宜 51%。Aaron Levie 给这一天起了名字:Jevons 悖论应用于 agent。

今日总结

主线:价格战正式开打,能力的红利第一次以账单的形式到达用户。

两家的发布把同一个方向写成了对偶。 Thibault 宣布 GPT-6 Sol 和 Luna 上线(23309 赞,近期最高):全线显著提升,写作和那种「一试就知道」的通用质感都在;API 永久降价 50%,让两个模型对一大堆新用例变得可行,订阅额度也能用得更远;再加一件小事——给所有 Plus、Pro 和 Business 账户加载一次 banked reset。Anthropic 侧,Cat Wu 宣布 Opus 5.5 成为 Claude Code 和 Claude 应用(含 Cowork)的默认模型(1308 赞):默认 effort medium,智能可比 Fable 5.1 但更快,限额在 Opus 5.5 上能多跑 25%。

Cherny 的两个实测是今天最硬的干货。 HAProxy 移植赛(6778 赞):让 Opus 5.5 和 Fable 5.1 各自把 HAProxy 从 C 移植到 Rust,两者都通过了几乎全部 HAProxy 测试,但 Opus 5.5 用时 9.5 小时对 12 小时,成本还低 51%。Lean 形式化验证(3324 赞):他用 Opus 5.5 对 Claude Agent SDK 做 Lean 形式化验证,几个短 prompt 就产出 16 个 PR,修复各种 bug 与竞态条件;TLA+ 也能用,两者结合查数据流、并发与状态管理。他坦承自己两种语言都不熟,但 Claude 精通——形式化方法的使用门槛第一次降到了「会写 prompt」。

Levie 把这一天写进经济学。 Opus 5.5 降价叠加 Sol 与 Luna token 价格砍半(655 赞):按同口径计算,AI 单任务成本的下降速度是历史上任何技术都不曾有过的;而成本每降一次,可部署 agent 的用例就大幅增加——这是应用于 agent 的 Jevons 悖论。Box 的实测数据作注(232 赞):Opus 5.5 在复杂企业知识任务上达到前沿能力,对比 Opus 5 少用 63% token、冗余度低 42%、快 30%,模型本身还更便宜。

第三方基准给对垒上了刻度。 Rauch 跑了新的 Next.js evals(1087 赞):Opus 5.5 得 87%、GPT 6 Sol 90%、Fable 5.1 87%、Grok 4.7 64%,但 Grok 便宜 2 到 7 倍。他还贡献了今天最动人的句子(1045 赞):Software will never die again,你喜欢 Google Reader?好,你可以生成并部署自己的版本,永远属于你。

能力溢出的方向感。 Thariq 的反思拿到 4528 赞:使用模型能力的正确方式不是把 10 倍的功能推上生产,而是花更多时间理解用户、做实验、建原型、搞懂你不懂的东西,从而上线真正有效的东西。Altman 则更正了昨天的预告(855 赞):argh,我说的是 VOICE 不是 video,抱歉让人失望——下周的主角是语音。Steinberger 的插曲够冷(850 赞):升级 macOS 27 后 ChatGPT 偶尔崩溃,Astra 顺藤摸出 libuv 里一个约 14 年的 bug。

今日关键词: 双旗舰 · 永久半价 · Jevons 悖论 · Lean 验证


官方博客

AI Hot:Anthropic 前线工程师分享 AI 驱动代码现代化项目的六步准备方法

AI Hot·2026-09-23 22:33 CST·原文链接

Anthropic 在 Notes from the Field 系列分享管理大型代码现代化项目的经验。

原本需要数年的现代化可以在数月或数周内完成,瓶颈从写代码转向组织动员。

与 GitHub 的 83 万行 Rust 迁移同一结论:agent 时代改造遗留系统的上限不在模型,在组织准备好没有。六步准备法给的就是动员侧的操作手册。

AI Hot:OpenAI 向乌克兰政府开放 Daybreak 网络防御计划

AI Hot·2026-09-23 21:00 CST·原文链接

OpenAI 宣布向乌克兰政府开放 Daybreak 计划,支持民用基础设施的网络防御,与乌克兰数字化转型部合作提供识别软件漏洞、开发和测试修复的工具。

背景数字:乌克兰 CERT-UA 在 2025 年处理了近 6000 起网络事件;此前法国、德国、波兰等欧洲防御方已使用其网络模型,其中 CERT Polska 借此发现第三方路由软件中的 6 个漏洞,厂商已发布修复。模型能力进入国家级防御体系的方式,先从补漏洞开始。

AI Hot:Qwen 发布 Qwen-Audio-3.1 全家桶,全线最高降价 95%

AI Hot·2026-09-23 17:11 CST·原文链接

Qwen 发布 Qwen-Audio-3.1:ASR、TTS 与 Realtime 全面升级,新增音频创作模型 TTS-Next 与音频理解模型 ASR-Next,五个模型覆盖理解、生成、交互与创作。

全线降价:TTS 约 7 折、Realtime 约 85 折、ASR 最高 95 折。Realtime 支持边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应。语音赛道在 Sol/Luna 与 Opus 同日发布的阴影里安静地完成了自己的降价周期。


X/Twitter 动态

Thibault Sottiaux(OpenAI Codex/ChatGPT):GPT-6 Sol 与 Luna 发布,API 永久半价

Thibault Sottiaux(thsottiaux)·2026-09-23 02:23 CST·原文链接1·原文链接2·原文链接3

Thibault 的发布长文拿下 23309 赞:

GPT-6 Sol and Luna are out. Not only are they a very significant improvement across the board... We are also permanently reducing the API price by 50%... And one more thing. We are loading a banked reset into all accounts of our Plus, Pro and Business users.

三个动作一次到位:全线显著提升(含写作与通用质感)、API 永久降价 50%、全量账户 banked reset。配套两条:efficiency and intelligence for all(12590 赞)与「可能是我们最可爱的发布,但仍然火力全开」(6045 赞)。Altman 昨天说的「值得等的下周」,提前到了这周。

Boris Cherny(Claude Code 负责人):Opus 5.5 的 HAProxy 赛测与 Lean 形式化验证

Boris Cherny(bcherny)·2026-09-23 00:45 CST·原文链接1·原文链接2·原文链接3

Cherny 的两条实测定义了 Opus 5.5 的工程水位。HAProxy 移植(6778 赞):Opus 5.5 与 Fable 5.1 各自把 HAProxy 从 C 移植到 Rust,都通过几乎全部测试,但 Opus 5.5 用 9.5 小时对 12 小时,成本再低 51%。Lean 验证(3324 赞):

I used Opus 5.5 to formally verify the Claude Agent SDK using Lean. A couple short prompts = 16 PRs fixing various bugs and race conditions.

他有时把 Lean 和 TLA+ 组合起来查数据流、并发与状态管理;两种形式化语言他都不熟,但 Claude 精通。附赠一条轻松的:Opus 还做了张信息图。

Cat Wu(Anthropic):Opus 5.5 成为默认模型,限额多跑 25%

Cat Wu(_catwu)·2026-09-23 00:39 CST·原文链接1·原文链接2

Cat Wu 宣布(1308 赞):Claude Opus 5.5 现在是 Claude Code 和 Claude 应用(含 Cowork)在 Pro、Max、Team 套餐的默认模型;她一直拿它当日常主力,喜欢它清晰的沟通和按她文风写作的能力。产品全线默认 effort medium,智能可比 Fable 5.1 但更快;在 Opus 5.5 上限额能多跑 25%。给 Opus 5.5 一个雄心勃勃的任务吧。

Aaron Levie(Box CEO):Jevons 悖论应用于 agent

Aaron Levie(levie)·2026-09-23 03:16 CST·原文链接1·原文链接2

Levie 总结这一天(655 赞):AI 疯狂的一天,前沿模型大幅变便宜:Opus 5.5 降价,GPT-6 Sol 和 Luna 的 token 价格再砍 50%。

The rate at which the cost per task drops in AI is unlike any other type of technology in history. This is Jevons paradox applied to agents.

同口径单任务成本的下降速度史上未见;每次降价,可部署 agent 的用例就大幅增加。Box 侧的实测(232 赞):Opus 5.5 对比 Opus 5 少用 63% token、冗余度低 42%、快 30%,模型本身还更便宜,对企业的 agentic 计算机使用、编码、分析都是重大利好。

Thariq(Anthropic):能力的正确用法是理解用户,不是 10 倍功能

Thariq(trq212)·2026-09-23 08:00 CST·原文链接1·原文链接2·原文链接3

Thariq 的反思拿到 4528 赞:

The right way to use model capabilities is not to ship 10x more features to prod. It's to spend more time understanding your users, trying experiments, building prototypes.

把能力红利花在理解用户、做实验、建原型、学不懂的东西上,才能上线真正有效的功能。配套两条:想做游戏的话,3D 生成能帮你想象游戏成型,但先把令人满足的游戏循环做好(他注明「说给自己听」);workflows 是他现在用 Claude 的大头,Fable 级智能配 workflow 的成本正合适。

Guillermo Rauch(Vercel CEO):四模型 evals 对照与「软件永不再死」

Guillermo Rauch(rauchg)·2026-09-23 06:03 CST·原文链接1·原文链接2·原文链接3

Rauch 跑了新的 Next.js evals(1087 赞):Opus 5.5 得 87%、GPT 6 Sol 90%、Fable 5.1 87%、Grok 4.7 得 64%,但 Grok 便宜 2 到 7 倍。他的宣言只有一句(1045 赞):

Software will never die again. You liked Google Reader? Cool, you can generate and deploy your own. Yours, forever.

软件永不再死:喜欢 Google Reader,就生成并部署自己的版本,永远属于你。第三条(1418 赞)赞 Anthropic 发布的 tastefulness:headless web 让页面可以长成任何 whimsical 的形态,AI 时代没有理由不推进设计前沿。

Alex Albert(Anthropic):一条 prompt 复刻 1906 年地震前的旧金山

Alex Albert(alexalbert__)·2026-09-23 02:34 CST·原文链接1·原文链接2

Albert 展示 Opus 5.5 的 3D 建模与视觉能力(890 赞):一条 prompt 在 Blender 里复刻 1906 年 4 月 17 日下午、地震前一天的旧金山 Market Street,从 Ferry Building 到 Fifth Street,含 Palace Hotel、Call Building、Chronicle Building、Lotta's Fountain 与 Emporium。建模前先从 1899-1905 年 Sanborn 火险地图(建筑足迹、高度、材质、住户)与 Miles Brothers 影像等史料建源文件。史实级的 prompt 工程遇上史实级的建模。

Sam Altman(OpenAI CEO):下周的主角是语音

Sam Altman(sama)·2026-09-23 05:38 CST·原文链接1·原文链接2

Altman 更正昨天的预告(855 赞):argh,我想说的是 VOICE 不是 video,抱歉让人失望。Sol 和 Luna 只是开胃菜,语音才是他说的「值得等」的主角。另一条(2124 赞)预告人事线:michelle 和团队接下来在做的东西会让人相当满意。

Peter Steinberger:Astra 挖出 libuv 14 年老 bug

Peter Steinberger(steipete)·2026-09-23 04:53 CST·原文链接

Steinberger 的排障记录(850 赞):升级 macOS 27 后 ChatGPT 偶尔崩溃,追查之下 Astra 找到 libuv 里一个约 14 年的 bug。从应用崩溃一路追到基础库的陈年缺陷,今天的前沿模型已经把「深挖」做成了默认动作。

Amjad Masad(Replit CEO):我的智能是超级智能

Amjad Masad(amasad)·2026-09-23 04:04 CST·原文链接

Masad 的语言学段子(935 赞):你的智能是假的(fake),是人工的(artificial);我的?是超级的(super),Super Intelligence,简称 SI。在满屏基准与价格战的发布日,这条是时间线的解压阀。

Dan Shipper(Every CEO):Opus 5.5 对 Sol-6 的 vibe check

Dan Shipper(danshipper)·2026-09-23 08:32 CST·原文链接

Shipper 自述今天涨了将近 1 万粉(37 赞),给新读者的两个起点:一是他在 Every 做的 Opus 5.5 对比 Sol-6 的 vibe check,二是他关于「AI 自动化为人类专家创造更多好工作」的分析。发布日的流量洪峰,最先被检验的永远是第一批评测。


数据采集时间:2026-09-23 14:42 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro