OpenAI 这次开源 Codex Harness,不是扔个玩具,而是直接把编程 Agent 的"执行层"交到了开发者手里。Apache-2.0 协议,零商业限制,GitHub 仓库 openai/codex 直接拉。
Harness 是什么?一句话:Agent = 模型 + Harness。模型是大脑,Harness 是让大脑能干活的身体——上下文管理、工具调用、权限审批、异常恢复,全靠它。
这次放出三大组件:
1️⃣ codex exec:CLI 工具,跑自动化流水线。CI 任务、后台脚本,一行命令搞定,输出结构化结果。
2️⃣ Codex SDK(TypeScript/Python):编程接口,精确控制任务生命周期。启动、恢复、流式传输,代码里直接调。
3️⃣ app-server:核心引擎。让你的应用连接本地 Codex 进程,支持持久会话、实时事件流、中途打断、工具暴露、人工审批。
最硬核的数据:仅调整 Harness 设计,GPT-5.6 Sol 在 ARC-AGI-3 基准测试上得分从 13.3% 飙到 38.3%,Token 输出还减少了 6 倍。同一款模型,换个"马具",表现直接翻倍。
已有落地案例:税务场景处理 7000 份申报表、准备时间缩短三分之一;Cisco 用它在其云平台构建了自然语言建应用的 App Builder。
这意味着什么?过去 AI 编程的竞争是"谁家模型更强",现在 OpenAI 告诉你:执行框架才是新战场。模型能力趋于同质化,谁能把 Agent 嵌入真实业务流、谁的可复用"车间"搭得好,谁就能赢。
开发者终于不用被聊天框绑架了。你可以把 Agent 塞进自己的仪表盘、工单系统、审批流里,让它像一名真正的"数字员工"一样干活。
但这里有个分歧:OpenAI 认为 Harness 应该"尽可能薄",让模型自己变强;Anthropic 则选择把 Harness 做厚做稳。两条路谁跑赢,可能决定未来 AI 编程工具的格局。
你怎么看?如果 Harness 开源了,你会基于它搭建自己的 Agent 执行框架,还是继续等厂商喂饭?
OpenAI CodexHarness AI编程 Agent框架
