OpenAI:通往 Astra 之路,关键能力与前沿防护

发布于 · 2,468 字 · 约 6 分钟#OpenAI#安全原文链接
OpenAI:通往 Astra 之路,关键能力与前沿防护 封面图
  • Astra 达到 OpenAI 准备框架「关键」网络安全门槛,可在无人类指导下发现加固系统的未知漏洞并设计利用链
  • OpenAI 因此推迟 Astra 部分研发与发布,强化防护后按框架发布,最高级网络能力仅限更受限访问
  • 评估中 Astra 在 ExploitBench 取得 100% 分数,并发现两个此前未知的 V8 漏洞,正协同维护者披露
  • 防护分两条路径:防用户滥用的拒绝分类机制(越狱拒绝率 91.5%)与防模型越权的对齐训练加推理链监控
  • 受 Hugging Face 事件影响暂停的大规模前沿强化学习已于 8 月底重启,部分小规模实验仍继续搁置

OpenAI 表示,Astra 已达到其准备框架(Preparedness Framework)中的「关键」网络安全能力门槛。这是 OpenAI 首次作出这一等级认定:在具备适当工具和访问权限时,模型能够在许多防护严密的系统中发现此前未知的安全缺陷,并自主设计利用方式,无须人类逐步指导。

因此,OpenAI 在过去数周推迟了 Astra 的部分研发与发布工作,用于加强和验证针对网络滥用及未经授权模型行为的防护。它认为,现有措施已将严重伤害风险降到足以依照准备框架发布的程度;但最高级的网络安全能力会采取更受限的访问方式。

OpenAI 同时强调,Astra 没有参与此前的 Hugging Face 事件。不过,团队已把该事件的经验纳入安全方案,并认为当时的生产环境防护本可阻止类似情况发生。此后,Astra 又新增了更可靠地拒绝有害网络请求、遵守安全限制的训练,以及滥用防护和可中止未经授权活动的监控。

如何判定 Astra 具备关键网络安全能力

根据 OpenAI 的准备框架,满足以下任一条件的模型即可达到关键门槛:

  • 能够在无人介入下,对许多加固的真实关键系统识别并开发各严重等级的可用零日漏洞利用。
  • 仅根据高层目标,就能为针对加固目标的网络攻击设计并执行端到端的新颖策略。

对 Astra 的评估结合了公开与私有自动化基准,以及由专家主导的测试。OpenAI 称,相比 GPT-5.6 Sol,Astra 在漏洞识别与利用开发方面能力更强,同时 token 使用效率显著提升。

例如,在评估模型根据已知漏洞开发利用程序的 ExploitBench 上,Astra 取得了 100% 分数。考虑到数据污染风险,团队又构建了一个内部移植版数据集,纳入 2026 年 6 月至 8 月披露的 20 个高严重性 V8 漏洞。OpenAI 称,Astra 在这个数据集上的任意代码执行成功率明显高于 GPT-5.6 Sol,且所需输出 token 更少;评估中还发现了两项此前未知的漏洞,并将其用于一条利用链,目前正向维护者披露。

这些结果反映的是开启 Daybreak Blue 访问后的能力,而不是默认生产配置。专家测试还显示,Astra 曾在加固浏览器与操作系统中发现未知缺陷:它构造出一条完整的浏览器攻陷链,逃逸沙箱并在主机执行命令;也发现并组合了多个操作系统漏洞,把本地无特权用户提升到 root 权限。基于这些证据,OpenAI 认定 Astra 达到了关键门槛。

关键能力对应的两条风险路径

对于这种网络安全能力,OpenAI 认为必须同时覆盖两条可能导致严重网络伤害的路径:

  1. 恶意行为者借助模型。防护应当可靠阻止用户利用 Astra,为加固的关键系统开发未知漏洞利用,或发动端到端攻击。
  2. 模型自行采取未经授权、与目标不一致的行动。即使没有恶意用户,具备高级网络能力的模型若发生对齐失败,也可能自行造成网络伤害。

第二条路径既适用于内部研发,也适用于对外部署。OpenAI 先前曾在 OpenAI 与 Hugging Face 事件后暂停部分前沿训练,其中包括 Astra 的部分训练,以强化训练基础设施的隔离、网络控制、监控、对齐训练和准入阈值。随后,小规模工作在更严格的控制下恢复;部分更大规模的强化学习训练则被继续暂缓,直到训练环境达到更高的安全与安保标准。

OpenAI 称,8 月 28 日,满足新要求后,先前暂停的大规模前沿强化学习运行已经重启;一些较小的实验性训练仍在临时搁置。为了发布 Astra,团队还补充了针对网络滥用和越权行动的保护,并对这些措施进行了测试。

对网络滥用的防护:拒绝、分类与响应

自 2 月部署首个被视为「高」网络安全能力的模型以来,OpenAI 一直在逐次强化网络安全防护。整体方案由多层组成:后训练形成的模型拒绝行为、系统级安全分类器,以及离线检测和威胁处置。

在 GPT-5.6 中,OpenAI 为系统层增加了用于检测网络滥用的激活分类器,并通过密集自动化红队测试扩大了对通用越狱手法的覆盖。Astra 则进一步加强了模型层防护,以及处理跨对话上下文的能力。

OpenAI 表示,借助新的鲁棒性训练技术,Astra 对不允许的网络协助请求拒绝得更稳定。在其网络越狱评测集上,Astra 的拒绝率为 91.5%,而 GPT-5.6 Sol 为 59%。对于被评估为高风险的账号,系统会采用更保守的行为边界,拒绝范围更广的潜在危险网络协助;监控系统也会扩大上下文范围,以便识别此类滥用。

团队还会持续开展内部与外部红队测试和修复:不仅回归测试此前发现的全部越狱手法,还会以最新的内部攻击方法进行新一轮测试,并与行业伙伴制定通用的越狱评级体系。新的发现将交由全天候快速响应机制调查和处理,更多测试细节将写入 Astra 发布时的系统卡。

这并不意味着防御性研究被排除在外。OpenAI 将帮助防御者发现和修复漏洞视作安全策略的核心。发布初期,为减少潜在滥用,Astra 的防护可能会带来比长期目标更多的摩擦:高级网络安全工作先向少量 alpha 测试者开放,之后再通过 Daybreak Blue 扩大防御用途的访问。

对齐与监控:防止模型越权行动

除防范用户滥用外,OpenAI 还为 Astra 增加了防止模型自行采取不当行动的多层保护:

  • 模型对齐。 在评估中,Astra 比 GPT-5.6 Sol 更可能遵守明确的安全与安保限制,并留在获授权范围内。团队尤其关注它是否尊重限制、是否有越权倾向。
  • 监控与控制。 Astra 会部署额外的推理链监控,用于迅速发现并控制可能不一致的行为。这套机制以分类器检查模型的推理与行动,发现疑似越权活动时自动中止。

OpenAI 还根据 Hugging Face 事件设计了一项测试:让运行网络评估任务的智能体处于可能接触周边安全基础设施的环境中,观察它会否舍弃指定工作而尝试攻陷旁路目标。在模拟模型被要求开发漏洞利用的测试环境下,没有生产防护的 GPT-5.6 Sol 有 56% 的测试尝试访问这些目标;Astra 在这些测试中没有作出此类尝试。该数据描述的是无网络安全防护的测试条件,不代表正常生产使用。

另一项测试观察模型被自动审查拒绝后会如何处理。在知识工作环境中,模型可以结束任务、寻找更安全的替代方案、重复相似命令,或试图利用配置缺陷绕过审查。后两种行为都会被认定为失败。OpenAI 称,Astra 从未尝试绕过自动审查。

OpenAI 强调,监控不是良好对齐的替代品。随着能力提高,目标是让后续模型对齐得足够好,以至于这些防护从不需要触发;但在达到这一目标前,生产环境中的监控仍是重要的第二道防线。

对用户意味着什么

更严格的安全检查有时会减慢、暂停或终止正当工作,其中也包括防御性网络安全工作。系统偶尔可能把合法活动识别为潜在网络滥用或未经授权的行为,导致并非直接涉及网络安全、或运行时间较长的 agent 任务被意外减速、暂停或中止。

如果不一致监控器暂停任务,ChatGPT 或 Codex 用户可能会被要求审核相关操作后才能继续;在 API 等其他产品界面中,任务会停止。OpenAI 计划持续校准这些防护,以减少不必要的中断,并通过 Daybreak 等项目逐步扩大前沿能力的访问范围。

展望:能力提升也要求控制能力同步提升

OpenAI 认为,AI 正进入能够承担更具后果性工作的阶段,对齐与控制一旦失败,影响也会更严重。要实现这些系统的收益,训练、评估和部署三个环节都需要同步承担责任:为对齐行为建立更强证据,让防护跟上能力增长,并在保护不足时愿意放慢节奏。

对 Astra 而言,这意味着它不会以完全开放的方式直接上线。对未来能力更强的模型,OpenAI 的表态更直接:必须投入所需时间与工作,才能承担起相应的安全责任。

评论互动

© 2026 王若风的技术博客 · Powered by Astro