AI Builders Digest 2026-09-07:Fortune 爆 Astra 基准数据被修改,Code Arena 登顶,执行能力贬值

发布于 · 1,474 字 · 约 4 分钟#Follow Builders#Models
AI Builders Digest 2026-09-07:Fortune 爆 Astra 基准数据被修改,Code Arena 登顶,执行能力贬值 封面图
  • Fortune 报道 OpenAI 自 9 月 3 日发布以来多次修改 GPT-6 Astra 基准数据:幻觉率从 4.2% 降至 2% 后又改回,跑分争议从方法论分歧升级为公告可信度问题
  • GPT-6 Astra(Max)以 1797 分登顶 Code Arena WebDev,领先第二名 Claude Fable 5.1 达 35 分、第三名 Claude Opus 5 为 1688 分,盲测竞技场成为第三方锚点
  • 卡兹克判断执行能力贬值、判断力断层:用户用 Astra 自主操控 Blender、Houdini、Unity 做出游戏 Demo,复刻旧金山艺术宫时自主搜索几百张参考图并翻到国会图书馆扫描件找柱子尺寸,多数工作夜间自主完成
  • Levie 称互联网对个人 agent 四处执行任务的未来几乎毫无准备;Zara 指出注意力缩短的时代危机正被 agent 加剧
  • Nikunj 展示 Fable 审查 Astra 全部代码提交的组合:模型审查模型成为执行贬值后判断力自动化的第一种流行形态

今天的 AI Builders Digest 主线是 Astra 的余震:Fortune 报道 OpenAI 自发布以来多次修改基准数据,幻觉率从 4.2% 降到 2% 后又改回,跑分争议从「分歧」升级为「可信度」;Code Arena WebDev 上 Astra 以 1797 分登顶、领先 Fable 5.1 达 35 分;卡兹克给出中文圈最热的判断:执行能力正在贬值,判断力出现断层。凌晨的 0907 期已收录自动化研究里程碑,本期为同日第二期。

今日总结

主线:跑分的信任危机,与执行贬值的共识。

基准数据被反复修改,性质变了。 Fortune 报道:自 9 月 3 日发布公告以来,OpenAI 多次修改 Astra 的评测基准数据,幻觉率曾从 4.2% 降至 2% 后又改回。三天前的「Epoch 169 vs AA 61」还可以说是方法论分歧,发布后静默改数则动摇的是「公告即存档」的基本预期。对照 Code Arena 的第三方实测(1797 分登顶、领先 35 分),能力是真的,但数据治理出了问题。

Code Arena 给了第三方锚点。 GPT-6 Astra(Max)以 1797 分登顶 Code Arena WebDev,第二名 Claude Fable 5.1(Max)落后 35 分,第三名 Claude Opus 5 为 1688 分。在厂商公告可信度受疑的当口,竞技场式的盲测投票价值被放大:跑分可以被改,几千个真实用户的偏好投票难改。

执行贬值成为公共议题。 卡兹克在 Astra 爆火后的判断流传最广:执行能力正在贬值,判断力出现断层。案例都在眼前:用户用 Astra 自主操控 Blender、Houdini、Unity、Aseprite 做出游戏 Demo,3D 复刻旧金山艺术宫的项目里,Astra 自己搜索几百张参考图、翻到美国国会图书馆的老扫描文件找柱子尺寸,多数工作在夜间自主完成。当「做出来」不再稀缺,「决定做什么、判断好坏」成为新的断层线。

互联网还没准备好迎接个人 agent。 Levie 的提醒(451 赞):互联网对「每个人的个人 agent 四处替他们执行任务」的未来几乎毫无准备,会涌现无穷的新问题——认证、限流、反欺诈、内容面向机器的形态。Zara 补了人文侧的担忧(78 赞):人类注意力缩短是这个时代最大的危机之一,而 agent 让它更糟。

今日关键词: 基准修改 · Code Arena · 执行贬值 · 判断力断层


官方博客

AI Hot:Fortune 报道 OpenAI 多次修改 Astra 基准数据

AI Hot·2026-09-06 14:46 CST·原文链接

据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据:Astra 幻觉率曾从 4.2% 降至 2%,之后又改回原值。

发布材料里的基准数字是行业配置资源的指挥棒。发布后静默修订,即便每次都有理由,累积的代价是「公告不可存档」。上周 Thibault 问「目标柱下一步挪到哪」,Fortune 的回答是:先别挪,把旧成绩改回来再说。

AI Hot:GPT-6 Astra 登顶 Code Arena WebDev,领先 35 分

AI Hot·2026-09-06 05:31 CST·原文链接

Code Arena WebDev 榜单更新:GPT-6 Astra(Max)以 1797 分登顶,第二名 Claude Fable 5.1(Max)落后 35 分,第三名 Claude Opus 5(Max)为 1688 分。

盲测投票的竞技场机制,正在成为跑分信任危机的最大受益者:厂商改数改不了用户的成对偏好。企业选型材料里,「Arena 排名 + 自家 eval」的组合会越来越常见。

AI Hot:卡兹克谈执行能力贬值与判断力断层

AI Hot·2026-09-07 08:08 CST·原文链接

GPT-6 Astra 上线后,大量用户用它自主操控 Blender、Houdini、Unity、Aseprite 等专业软件:游戏 Demo、3D 复刻旧金山艺术宫等作品密集出现。艺术宫案例里,Astra 自己搜索几百张参考图,一路翻到美国国会图书馆的老扫描文件里找柱子尺寸,多数工作在夜间自主完成。

卡兹克由此给出流传最广的判断:执行能力贬值,判断力断层。检索、建模、渲染这些「做」的环节被压缩后,价值向「定义问题、设定标准、判断优劣」迁移,而后者恰恰是最难外包的。


X/Twitter 动态

Aaron Levie(Box CEO):互联网对个人 agent 毫无准备

Aaron Levie(levie)·2026-09-07 07:02 CST·原文链接

平台层的预警(451 赞):互联网对「每个人的个人 agent 四处替他们执行任务」的未来几乎毫无准备,会涌现无穷的新问题。登录、验证码、限流、反爬、内容授权,整套 Web 基础设施都默认「用户是人」。上周 Rauch 的 WebMCP 讲的是给 agent 修路,Levie 讲的是路面以下的承重:两者都要重做。

Zara Zhang(独立开发者):注意力危机被 agent 加剧

Zara Zhang(zarazhangrui)·2026-09-07 12:56 CST·原文链接

人文侧的冷水(78 赞):我们这个时代最大的危机之一是人类注意力时长的缩短,而 agent 让它更糟。当信息消费、筛选、回应都被代劳,人剩下的那部分注意力该投向哪里,是比效率更根本的问题。执行贬值之后,注意力是第二块被重新定价的资产。

Nikunj Kothari(FPV Ventures 合伙人):Fable 审查 Astra 的每一次提交

Nikunj Kothari(nikunj)·2026-09-07 11:12 CST·原文链接

一组正在发生的生产组合(26 赞):Fable 负责审查 Astra 的每一次代码提交,「this fix is the real deal」。Fable 当 PM、Astra 当工程师的搭配「undefeated」。模型审查模型,正是执行贬值后「判断力」的第一种自动化形态,也是竞争模型互相打工的第一个流行梗。


数据采集时间:2026-09-07 23:26 CST

评论互动

© 2026 王若风的技术博客 · Powered by Astro