OpenAI 把 Harness 开源了:AI 用得好不好,从来不在提示词
- OpenAI 将 Codex Harness 整体开源:codex exec CLI、官方 SDK(TypeScript/Python)、app-server 三大组件,Apache-2.0 可改可商用
- 官方数据:保留推理与上下文压缩两项 Harness 调整,让 GPT-5.6 Sol 在 ARC-AGI-3 从 13.3% 提升到 38.3%,输出 token 减少六倍
- Thrive Holdings 与 Crete 将其嵌入税务准备流程,试点处理 7000 份申报,准备时间缩短约三分之一;Cisco 用 SDK 做了 App Builder
- 官方演示 Relay:上下文从界面来、工具从 MCP 来、写操作必须人工审批,全程没有聊天框
- Harness 从各家私活变成公共基建,竞争上移一层:Agent 循环归 OpenAI,业务规则和沉淀的 Skills 归你
大家好,我是若风。
六月三十号,我写过一篇文章,核心判断就一句话:
模型和算力是厂商的事,你能拉开差距的,只有那套 Harness。
本周,OpenAI 给这个判断补了一个官方注脚。
他们宣布把 Codex 的底层核心框架 Harness 整体开源——Apache-2.0 协议,代码在 openai/codex 仓库,可改、可商用。
说实话,不是发新模型。但对天天琢磨「怎么把 AI 用稳」的人来说,这比新模型重要。
发生了什么
一句话讲完:OpenAI 把驱动自家编程智能体的那套执行系统,整个放了出来。
不是开源一个模型权重,而是那套真正干活的「底盘」——理解任务、维持记忆、调工具、报进度、处理失败、关键时刻停下来等人审批,全在里面。
除了这次的三件组件(下面细说),官方博客还顺带确认了两件事:GitHub 和 JetBrains 在把 Codex 引入现有 IDE 工作流,也就是不再要求你迁去它们的地盘,而是它们来找你。
Greg Brockman 转发时说:「Codex 能驱动的远不止编程工具。」
顺带一提,同一个仓库的 Rust 工程和沙箱设计,我前两天刚拆过一篇:OpenAI 管它叫轻量级,Codex 仓库里躺着 115 个 Rust crate。这次开源的 Harness,就住在这个仓库里。
官方替我说了那句话
我六月观察到的现象是:大多数人用 AI,是把所有事塞进一个通用聊天框,答案不对,就在对话里反复拉扯。
OpenAI 官方博客的说法更直接:与其让每个团队把熟悉的工作流硬搬进一个通用代码助手,不如把 Agent 直接带进围绕实际工作设计的软件里。
安全分析师看的是预警队列,客服工程师看的是账户历史,产品经理看的是需求看板。对真正干活的人来说,重要的不是聊天框,而是眼前的业务界面。
界面本身就是最重要的上下文。
这句话我六月想写没写出来,官方替我写了。
最硬的证据:同一个模型,差三倍
官方博客里的一组数据,值得单独拎出来看。我对着官方博客把这几个数字核了两遍,没抄错。
在难度极高的 ARC-AGI-3 基准上,OpenAI 只对 Harness 动了两刀——保留推理、上下文压缩。GPT-5.6 Sol 的得分从 13.3% 涨到 38.3%,输出 token 反而少了六倍。
模型一个字没换,换的只是挽具。
这是我六月那个公式的实测版:
模型 + 算力 + Harness 约束 = AI 的真实战斗力
前两项锁死的情况下,第三项一动手:分数三倍,成本六分之一。
三件工具,按需求对号入座
这次放出三个组件,不用全学,按你要干的事选:
codex exec(CLI)——跑自动化的。 CI 任务、后台脚本、一次性批处理。有边界的 Agent 工作流,返回结构化输出,简单直接。
Codex SDK(TypeScript / Python)——写程序用的。 用代码启动、恢复、流式传输任务,精准控制线程与任务的生命周期。
Codex app-server——把 Agent 装进产品用的。 这次真正的重头戏。通过 JSON-RPC 协议连接本地 Codex 进程:保持持久对话状态、流式看它在干什么、中途打断、把你应用的工具暴露给 Agent、处理人工审批(Human-in-the-loop)。
前两个是「开他们的车」,第三个是「把发动机拆下来,装你自己的底盘」。
已经有人把它装进了非编程产品
三个案例,一个比一个离编程远。
税务。 Thrive Holdings 和 Crete 把 Harness 嵌进专业税务准备流程,试点跑了 7000 份申报表,准备时间缩短约三分之一。财务是容错率最低的场景之一——这件事比「Agent 写代码」更能说明 Harness 的成色。
Cisco。 用 Codex SDK 在云控制平台里做了 App Builder,客户用自然语言创建自定义应用,底层流转全部交给 Harness。
官方演示 Relay。 一个物流运营看板,全程没有聊天框:业务员选中延误货单,点「比较恢复方案」;应用自动把界面上下文喂给 Agent,调应用自有的 MCP 工具取实时数据;方案出来后弹审批框,人点了同意才执行重新订舱;完成后台板自动刷新。
做产品的人应该把 Relay 这几步看一遍。它演示的不是 Agent 多聪明,而是约束放在哪:上下文从界面来,工具从 MCP 来,写入必须过人。
app-server 我自己还没跑起来,等有实测记录再来补一篇。先把判断放在这。
挽具从私活变基建,差距往哪移
这是我真正想说的部分。
六月写那篇的时候,这个判断更像一种直觉,说出来心里其实没底。这两天看到官方数据,算是有点释然。
过去一年,Harness 是各家公司的私活:Claude Code 一套、Codex 一套、Cursor 一套,都藏在产品里。你觉得 A 顺手、B 别扭,又说不清为什么——差异大半在那套看不见的挽具上。
现在 OpenAI 把自家挽具开源了。与其说是开源了一个框架,不如说是把一条护城河填平了。私活变基建,竞争不会消失,只会往上移一层。
官方总结了三个「归你」:
- 界面归你:用户继续用熟悉的看板、编辑器、地图,Agent 是隐形帮手,不是霸占屏幕的主角;
- 上下文与工具归你:内部系统、机密文档、API 通过 MCP 直接开放给 Agent;
- 边界归你:哪些危险动作必须人工放行,宿主应用说了算。
翻译成一句话:Agent 循环归 OpenAI,业务规则归你。
而再往上一层,还是我六月的那个推论:底座免费之后,值钱的是沉淀在底座之上的约束。Skills 本质是可复用的 Harness 模块——这条线没有被开源动摇,反而被加固了:发动机和底盘都白送了,比的就是谁的方向盘打得准。
写在最后
回到那个公式:
模型 + 算力 + Harness 约束 = AI 的真实战斗力
六月我说它,是一个个人体感;现在,它是一个有官方数据、有开源代码支撑的公共判断。
挽具人人可得了。
接下来的问题是:你打算套着它,去驾驭什么。
参考资料:
相关阅读:

评论互动