AI Builders Digest 0907:OpenAI 达成自动化研究实习生里程碑,CoT 监控效果减弱
- OpenAI 宣布达成「自动化研究实习生」里程碑:可在人类监督下完成熟练研究员需数天的明确任务,并计划 2028 年 3 月前造出自动化 AI 研究员
- 内部数据量化进度:截至 8 月中旬研究组织每投入 1 个人工工作日即消耗 3.1 个 agent 工作日运行时长,但作者强调该比值衡量运行时间而非等效生产力,并呼吁其他 AI 公司公开同类数据
- OpenAI 长文《An Alien Mind》系统陈述对齐困境:回溯 2023 年 RLSlow 起点,区分目标对齐与价值对齐,坦白链式思维监控效果正随模型能力提升而逐步减弱(GPT-6 Astra 对齐显著优于 GPT-5.6 Sol)
- 加速与监测的剪刀差同日披露:研究自动化以 1:3.1 扩张而主要对齐监测手段效果在下降;文章呼吁自愿放缓扩展、建立第三方安全门槛、加强国际协调;X/Twitter 与播客信源自 09-05 后无更新,本期由官方博客区构成
今天的 AI Builders Digest 主线是 自动化研究与对齐监测的两面同日披露:OpenAI 一边宣布达成「自动化研究实习生」里程碑,Agent 运行时已达人工的 3.1 倍,并给出 2028 年 3 月「自动化 AI 研究员」的时间表;一边在长文《An Alien Mind》里承认链式思维(CoT)监控的效果正随模型能力提升而减弱。加速与监测的剪刀差,第一次被同一家实验室同时摆上台面。X/Twitter 与播客信源自 09-05 后无更新,本期由官方博客区构成。
今日总结
主线:Agent 干活的速度,超过了人类看住它的能力。
自动化研究实习生提前达标。 去年秋天设定的目标是在今年 9 月拥有「自动化研究实习生」:在人类监督下完成熟练研究员需数天的明确任务。OpenAI 宣布已达成,并计划 2028 年 3 月前造出自动化 AI 研究员。配套的内部数据:截至 8 月中旬,研究组织每投入 1 个人工工作日,就消耗 3.1 个 Agent 工作日的运行时长。
3.1 倍的正确读法。 原文作者特意强调:该比值衡量的是运行时间,不是等效生产力。Agent 可以 7×24 地跑,人类研究员不行;但「跑了多久」与「做成了什么」之间的换算系数,正是 2028 年 3 月那个目标要回答的问题。作者同时援引 OpenAI 员工观点:递归自我改进(RSI)或成未来几年 AI 能力的关键,并呼吁其他 AI 公司公开同类数据。行业第一次有了可以横向比较自动化研究进度的锚点。
CoT 监控的效果在减弱。 《An Alien Mind》系统阐述目标对齐与价值对齐的区分,回溯 2023 年 RLSlow 项目确认推理模型可扩展训练的起点,并给出一个诚实到近乎刺眼的判断:链式思维监控的效果正随模型能力提升而逐步减弱。GPT-6 Astra 在对齐上显著优于 GPT-5.6 Sol,但「看得懂它想什么」的窗口在收窄。文章的呼吁包括:自愿放缓扩展、建立第三方安全门槛、加强国际协调。
剪刀差是本期的真正新闻。 把两篇放在一起读:研究自动化以「人工 1 : agent 3.1」的速度扩张,而主要对齐监测手段(CoT 监控)的效果在下降。上周 DseWiki 披露框架改革、Ryan Greenblatt 的 2029 接管预警、METR 的独立调查,都是这把剪刀差的社会化表现。披露越诚实,问题越清楚。
今日关键词: 研究实习生 · 3.1 倍运行时 · CoT 监控 · 2028 研究员
官方博客
AI Hot:OpenAI 内部研究加速报告,2028 年 3 月的自动化研究员
AI Hot·2026-09-06 16:00 CST·原文链接
OpenAI 发文披露自动化研究进展:已达成去年秋天设定的目标,今年 9 月拥有自动化研究实习生,即「可在人类指导下完成耗时数天的明确研究任务」的 agent;下一步时间表是 2028 年 3 月前造出自动化 AI 研究员。
从「实习生」到「研究员」的跨度,正是从「执行明确任务」到「自主定义问题」的跨度。此前 Sam Altman 与 Matt Turck 都说过所有前沿实验室都在做 RSI,这是第一份带日期的公开路线图。
AI Hot:agent 运行时达人工 3.1 倍,OpenAI 呼吁同行公开数据
AI Hot·2026-09-07 02:23 CST·原文链接
里程碑的量化注脚:截至 8 月中旬,OpenAI 研究组织每投入 1 个人工工作日,就使用 3.1 个 agent 工作日的运行时长。原文作者提醒:该比值衡量运行时间而非等效生产力。
更有分量的部分是姿态:作者援引 OpenAI 员工观点称 RSI 或成为未来几年 AI 能力的关键,并呼吁其他 AI 公司公开同类数据。自动化研究的进度条第一次有了可比较的刻度,前提是有人接这个梗。
AI Hot:《An Alien Mind》,对齐困境的系统陈述
AI Hot·2026-09-06 17:00 CST·原文链接
OpenAI 长文《An Alien Mind》三个层次:
- 回溯:2023 年 RLSlow 项目确认了推理模型可扩展训练的起点
- 区分:目标对齐(干你让它干的事)与价值对齐(符合你的意图与价值)是两个问题
- 坦白:链式思维监控的效果正随模型能力提升而逐步减弱;GPT-6 Astra 的对齐显著优于 GPT-5.6 Sol,但监测手段的衰减是结构性的
文末的政策主张:自愿放缓扩展、建立第三方安全门槛、加强国际协调。与上周的误对齐披露框架改革连读,OpenAI 的安全叙事正从「我们有能力」转向「我们需要制度」。
数据采集时间:2026-09-07 02:57 CST

评论互动