我让 Codex 将我用它以来的经验和心得,还挺有意思
一开始用 Codex,我的期待其实很直接:它能不能帮我把事情做快一点。
写几段代码、改一份文案、查一个错误、搭一个小工具——这些当然都很有用。但用了一段时间以后,我发现真正改变工作方式的,并不是「它能一次给出多好的答案」,而是它能不能进入我已经在做的事:理解我为什么要做、哪些东西不能乱动、结果怎么验收、出了问题该停在哪里。
Chin harness 就是在这个过程中慢慢长出来的:它是我给长期协作搭的一套个人 creator-agent 工作底盘。
它不是一个把提示词攒起来的文件夹,也不是给 AI 塞一大段人设后祈祷它发挥稳定。它定义了人格和判断放在哪里,项目材料放在哪里,什么任务该直接做,什么任务必须先看证据,什么经验值得沉淀成 Skill,什么错误不能再让它重复。
回头看,Codex 和 Chin harness 这段时间带给我最有价值的,不是「AI 能替我做多少」,而是我开始重新理解:什么样的工作,才值得交给一个 Agent。
先让它做事,再决定它该记住什么
我早期更容易把 AI 当成一次性的对话对象。每个新任务都重新描述背景、贴素材、解释审美、补充限制。它有时答得很好,但换一个窗口,前面的判断又像没发生过。
后来我不再试图用一份很长的总提示词解决所有问题,而是把信息按作用拆开。
- Chin harness 管的是稳定的行为:我的表达和判断、任务怎么路由、什么时候需要事实锚点、图像和视频该如何验收。- Projects 管的是具体工作:封面、PPT、图像修复、内容运营、小工具、原型和交付物。- KCLab 管的是来源材料和被整理过的知识:原文、阅读笔记、可复用的观察。
这听起来像整理文件,但实际解决的是协作边界。
比如,一个项目里的临时截图、一次生成的中间图、某条微博的数据复盘,并不应该都变成 Chin harness 的长期规则;一条已经反复验证、会影响以后所有任务的经验,才值得写回工作流或评测。否则系统很快就会变成另一种混乱:什么都记住,等于什么都找不到。
我在这件事上也走过弯路。曾经试图把大量材料往知识库里迁,后来又把边界重新拉回来。现在的结论很朴素:不要让一个地方同时承担规则库、项目盘和资料仓库。Chin harness 是行为的源头,项目文件夹是工作的现场,知识库是可查询的外部记忆。分开以后,Codex 才知道在不同任务里该信什么、该找什么。
Codex 真正有用的时候,不只是会写代码
我用它做过的事已经不只是一类。
它参与过内容和视觉工作:封面策略、图像修复、AI 视频分镜、提示词和参考图的拆解;也做过比较工程化的东西:额度菜单栏工具、图片分析与生图的本地工作台、网页与自动化流程;还有一部分是过去很容易被忽略的杂活:把高频状态收进一个工具、把临时脚本变成可重复运行的资产、把一次失败的排查写成以后能复用的诊断路径。
最明显的变化是,我不再只问「你能不能帮我生成一个结果」,而会先问:这件事在整个流程里是哪一环?
以图像修复为例。反复 AI 编辑之后,一张图可能构图还行,但像素已经脏了:边缘发糊、材质被涂抹、局部越修越假。继续局部修,常常只是在放大污染。后来我把这类任务和普通高清重绘拆开:前者是保住构图和关键约束、切断污染像素后全图重建;后者才是清晰度重建和最终分辨率导出。它们不是同一件事,所以也不能靠同一个「一键修复」来处理。
同样的道理放到 AI 视频里也成立。一个修改意见不一定是在改一句 prompt,它可能在改镜头、叙事连续性、角色身份,甚至在改最后的交付承诺。参考图也不是越多越好:角色图负责身份,风格图负责光影和完成度,脚本负责场景和镜头。如果新的参考进来了,旧描述里的冲突词还要删掉,不是不断追加一句 reference lock 就能解决。
Codex 在这里不是替我「更会想」,而是帮我把这些容易混在一起的东西拆开,再把改动传到应该受影响的位置。
我越来越在意:能跑,不等于能交付
这大概是用 Codex 之后最强烈的一条经验。
它当然能很快做出一个能运行的版本,但「能运行」只是项目开始变得真实的那一刻,不是结束。
我做过一个查看 Codex 使用额度的菜单栏小工具。功能跑起来之后,后面还有一连串完全不同的问题:图标在深浅背景里是否清楚、刷新时 CPU 是否异常、依赖的本地协议会不会随版本变化、没有 Developer ID 和公证时,能不能把 ad-hoc 的应用当成普通用户可直接安装的成品。
答案是不能。
这个项目让我重新确认了一件很基础的事:Agent 可以很快把「想法」推进到「可运行」,但签名、公证、发布说明、兼容性、用户第一次打开时的信任,仍然是产品的一部分。不能因为 Codex 把东西做出来了,就跳过这些现实世界里的摩擦。
同样,生成一张图显示成功,也不等于文件真的落在项目里;预览九宫格不等于每个镜头都有可交付的最终帧;界面看着不错,也要在长提示词、缩放、旧数据迁移、撤销和加载状态下再看一次。现在我会更在意验收对象本身:实际文件、像素尺寸、可访问链接、测试报告、能不能重新运行,而不只是聊天框里一段看上去很顺的描述。
所以我现在基本不再把「看起来更清晰」叫作 4K,也不把「模型说生成完成」直接叫作交付完成。
越自动化,越需要边界和停止条件
很多人对 Agent 的想象是:让它尽可能自主、尽可能并行、尽可能不停地跑。
实际做下来,我的判断刚好反过来一点:好的自动化不应该是无约束的自动化。
在 Image Lens 这样的创作工具里,分析可以有限并行,但生成默认更适合串行、可取消、可追溯;删掉画布上的一个节点,不等于删除素材本体,更不该抹掉历史生成记录和当时的输入快照。这样做看上去不够「全自动」,但它能保住创作过程里最重要的东西:你为什么做出这个判断,后面还能不能回去看。
我也开始给工作流写停止条件。图像重建连续两次定向重试还没有改善、证据不足、关键身份约束冲突,就应该停下来要更多输入或换路径;不能让 Agent 一直重试,最后产出一堆看似努力、其实越来越偏的结果。
同样,外部链接只有预览卡而没有正文时,也不能根据标题硬总结;能连上一个服务,不等于有发送权限;一个演示现场能跑,不等于已经真实部署。这些都不是保守,而是把「不知道」当作系统的一种正常状态。
我觉得这比让 AI 总能给答案更重要。
Chin harness 不是让 AI 更像我,而是让它少在不该猜的地方猜
很多人理解个人 AI 系统,会先想到「人设」:语气像不像、文案像不像、能不能模仿一个人的表达。
这当然重要,但对我来说,Chin harness 更重要的部分其实是判断纪律。
它会要求:不能把没亲测的工具写成亲测;不能把外部作者的观点伪装成我的发现;不能为了人格一致,替我编「我会买」或「我不喜欢」这种个人态度;图像分析要区分看得见的证据、推断和用户明确给的约束。
这会让输出少一点无所不知的顺滑感,但更像一个能进入真实项目的协作者。尤其做视觉、内容和产品时,最危险的不是它偶尔说「我不知道」,而是它把不确定的话说得太笃定。
同样,Chin harness 也不是要求每一个任务都走完整流程。简单的事就直接做;需要判断的事再展开;涉及交付、外部权限、来源真实性或视觉风险时,才把检查加上来。系统不是为了展示自己有多复杂,而是让该快的时候快,该严的时候严。
我现在会怎样和 Codex 协作
如果要把这段时间压缩成一套实用做法,大概是下面几条。
1. 先给它一个真实对象,不只给一个抽象愿望。把文件、参考、限制、现有流程和「什么算完成」说清楚,结果会比「帮我做得高级一点」可靠得多。2. 先判断问题发生在哪一层。是素材脏了、构图错了、提示词冲突、镜头不连续、UI 不好用,还是交付没验证?不要把所有问题都当成「再改一版 prompt」。3. 让它产出可检查的东西。文件落盘、像素尺寸、测试、可复跑脚本、来源链接、变更记录,都比一句「已经完成」可靠。4. 把重复出现的动作沉淀下来。一次性的临时脚本,如果已经是后续生产的输入资产,就应该变成项目里的正式脚本或 Skill,而不是下次重新聊天再拼一遍。5. 给自动化留刹车。写清楚什么时候要人工看、什么时候要停、什么时候必须向用户确认。不是所有任务都应该由 Agent 自己做完。6. 把规则、知识和项目分开存。不要试图用一个库解决所有记忆问题;不同信息要服务不同的下一步。
结尾:我想要的不是一个更会说话的 AI
用 Codex 和 Chin harness 到现在,我越来越不把 AI 当作一个「问什么答什么」的聊天框。
我更希望它像一个能进入工作现场的协作者:知道什么时候可以直接帮我推进,什么时候应该先检查;能把一次次临时动作变成资产,也能在证据不足时老实停下来;能替我省掉重复劳动,但不替我跳过判断和验收。
这套东西还远没有完成。规则会过期,工具会变,项目也会暴露新的漏洞。最近一次结构回归也并非全绿,临时目录的数量仍然超出设定边界。这个小失败反而提醒我:把系统写出来,不等于系统从此会自己保持干净。
但我现在已经不太追求一个永远完美的 AI 工作流了。更想做的是让它在每一次真实任务之后,能少犯一个重复的错,少让我重新解释一次,也多留下一个下次能直接用上的东西。
对我来说,这可能才是 Codex 和 Chin harness 最有意思的地方:不是替我完成工作,而是陪我把做事的方法慢慢做出来。