OpenAI 把 Harness 开源了:AI 用得好不好,从来不在提示词

发布于 · 1,735 字 · 约 4 分钟#OpenAI#Agents原文链接
OpenAI 把 Harness 开源了:AI 用得好不好,从来不在提示词 封面图
  • OpenAI 将 Codex Harness 整体开源:codex exec CLI、官方 SDK(TypeScript/Python)、app-server 三大组件,Apache-2.0 可改可商用
  • 官方数据:保留推理与上下文压缩两项 Harness 调整,让 GPT-5.6 Sol 在 ARC-AGI-3 从 13.3% 提升到 38.3%,输出 token 减少六倍
  • Thrive Holdings 与 Crete 将其嵌入税务准备流程,试点处理 7000 份申报,准备时间缩短约三分之一;Cisco 用 SDK 做了 App Builder
  • 官方演示 Relay:上下文从界面来、工具从 MCP 来、写操作必须人工审批,全程没有聊天框
  • Harness 从各家私活变成公共基建,竞争上移一层:Agent 循环归 OpenAI,业务规则和沉淀的 Skills 归你

大家好,我是若风。

六月三十号,我写过一篇文章,核心判断就一句话:

模型和算力是厂商的事,你能拉开差距的,只有那套 Harness。

本周,OpenAI 给这个判断补了一个官方注脚。

他们宣布把 Codex 的底层核心框架 Harness 整体开源——Apache-2.0 协议,代码在 openai/codex 仓库,可改、可商用。

说实话,不是发新模型。但对天天琢磨「怎么把 AI 用稳」的人来说,这比新模型重要。

发生了什么

一句话讲完:OpenAI 把驱动自家编程智能体的那套执行系统,整个放了出来。

不是开源一个模型权重,而是那套真正干活的「底盘」——理解任务、维持记忆、调工具、报进度、处理失败、关键时刻停下来等人审批,全在里面。

除了这次的三件组件(下面细说),官方博客还顺带确认了两件事:GitHub 和 JetBrains 在把 Codex 引入现有 IDE 工作流,也就是不再要求你迁去它们的地盘,而是它们来找你。

Greg Brockman 转发时说:「Codex 能驱动的远不止编程工具。」

顺带一提,同一个仓库的 Rust 工程和沙箱设计,我前两天刚拆过一篇:OpenAI 管它叫轻量级,Codex 仓库里躺着 115 个 Rust crate。这次开源的 Harness,就住在这个仓库里。

官方替我说了那句话

我六月观察到的现象是:大多数人用 AI,是把所有事塞进一个通用聊天框,答案不对,就在对话里反复拉扯。

OpenAI 官方博客的说法更直接:与其让每个团队把熟悉的工作流硬搬进一个通用代码助手,不如把 Agent 直接带进围绕实际工作设计的软件里。

安全分析师看的是预警队列,客服工程师看的是账户历史,产品经理看的是需求看板。对真正干活的人来说,重要的不是聊天框,而是眼前的业务界面。

界面本身就是最重要的上下文。

这句话我六月想写没写出来,官方替我写了。

最硬的证据:同一个模型,差三倍

官方博客里的一组数据,值得单独拎出来看。我对着官方博客把这几个数字核了两遍,没抄错。

在难度极高的 ARC-AGI-3 基准上,OpenAI 只对 Harness 动了两刀——保留推理、上下文压缩。GPT-5.6 Sol 的得分从 13.3% 涨到 38.3%,输出 token 反而少了六倍。

模型一个字没换,换的只是挽具。

这是我六月那个公式的实测版:

模型 + 算力 + Harness 约束 = AI 的真实战斗力

前两项锁死的情况下,第三项一动手:分数三倍,成本六分之一。

三件工具,按需求对号入座

这次放出三个组件,不用全学,按你要干的事选:

codex exec(CLI)——跑自动化的。 CI 任务、后台脚本、一次性批处理。有边界的 Agent 工作流,返回结构化输出,简单直接。

Codex SDK(TypeScript / Python)——写程序用的。 用代码启动、恢复、流式传输任务,精准控制线程与任务的生命周期。

Codex app-server——把 Agent 装进产品用的。 这次真正的重头戏。通过 JSON-RPC 协议连接本地 Codex 进程:保持持久对话状态、流式看它在干什么、中途打断、把你应用的工具暴露给 Agent、处理人工审批(Human-in-the-loop)。

前两个是「开他们的车」,第三个是「把发动机拆下来,装你自己的底盘」。

已经有人把它装进了非编程产品

三个案例,一个比一个离编程远。

税务。 Thrive Holdings 和 Crete 把 Harness 嵌进专业税务准备流程,试点跑了 7000 份申报表,准备时间缩短约三分之一。财务是容错率最低的场景之一——这件事比「Agent 写代码」更能说明 Harness 的成色。

Cisco。 用 Codex SDK 在云控制平台里做了 App Builder,客户用自然语言创建自定义应用,底层流转全部交给 Harness。

官方演示 Relay。 一个物流运营看板,全程没有聊天框:业务员选中延误货单,点「比较恢复方案」;应用自动把界面上下文喂给 Agent,调应用自有的 MCP 工具取实时数据;方案出来后弹审批框,人点了同意才执行重新订舱;完成后台板自动刷新。

做产品的人应该把 Relay 这几步看一遍。它演示的不是 Agent 多聪明,而是约束放在哪:上下文从界面来,工具从 MCP 来,写入必须过人。

app-server 我自己还没跑起来,等有实测记录再来补一篇。先把判断放在这。

挽具从私活变基建,差距往哪移

这是我真正想说的部分。

六月写那篇的时候,这个判断更像一种直觉,说出来心里其实没底。这两天看到官方数据,算是有点释然。

过去一年,Harness 是各家公司的私活:Claude Code 一套、Codex 一套、Cursor 一套,都藏在产品里。你觉得 A 顺手、B 别扭,又说不清为什么——差异大半在那套看不见的挽具上。

现在 OpenAI 把自家挽具开源了。与其说是开源了一个框架,不如说是把一条护城河填平了。私活变基建,竞争不会消失,只会往上移一层。

官方总结了三个「归你」:

  • 界面归你:用户继续用熟悉的看板、编辑器、地图,Agent 是隐形帮手,不是霸占屏幕的主角;
  • 上下文与工具归你:内部系统、机密文档、API 通过 MCP 直接开放给 Agent;
  • 边界归你:哪些危险动作必须人工放行,宿主应用说了算。

翻译成一句话:Agent 循环归 OpenAI,业务规则归你。

而再往上一层,还是我六月的那个推论:底座免费之后,值钱的是沉淀在底座之上的约束。Skills 本质是可复用的 Harness 模块——这条线没有被开源动摇,反而被加固了:发动机和底盘都白送了,比的就是谁的方向盘打得准。

写在最后

回到那个公式:

模型 + 算力 + Harness 约束 = AI 的真实战斗力

六月我说它,是一个个人体感;现在,它是一个有官方数据、有开源代码支撑的公共判断。

挽具人人可得了。

接下来的问题是:你打算套着它,去驾驭什么。

参考资料:

相关阅读:

评论互动

© 2026 王若风的技术博客 · Powered by Astro