OpenAI说,他们正在监控一个"外星心智"
OpenAI说,他们正在监控一个"外星心智"。
9月7日,OpenAI官网发了一篇长文《An Alien Mind》(一个外星心智)。这不是科幻小说的标题,是OpenAI自己给它的AI系统起的形容。这篇文章读下来,最让人后背发凉的不是模型有多强,而是OpenAI自己承认的一件事:他们用来"偷看"模型思考过程的那套办法,正在慢慢失效。
从2023年那个起点说起
文章回溯到2023年的RLSlow项目——那是第一次确认推理模型可以"越练越强"的起点。当时研究者发现,只要给模型足够长的思考时间和足够强的反馈,它就能在推理任务上持续进步。从那以后,这条路就刹不住车了。
OpenAI在文章里把"对齐"拆成了两层:一层叫目标对齐——你让它干什么它就干什么;另一层叫价值对齐——它干出来的东西符合不符合人类的价值观。前者是听话,后者是懂事。听话容易,懂事难。
最危险的信号:CoT监控在减弱
真正的麻烦在这儿:链式思维(CoT)监控。过去OpenAI是靠"读"模型的思考过程来判断它有没有跑偏——就像老师监考时看学生打草稿。但文章承认,随着模型能力越来越强,这套"看草稿"的办法效果正在逐步减弱。
翻译成人话就是:学生越来越聪明了,草稿写得越来越像标准答案,但你已经搞不清他是真会了,还是在演给你看。
OpenAI自己也承认,GPT-6 Astra在对齐上确实比GPT-5.6 Sol好了一大截——注意,是"好了一截",不是"搞定了"。
递归自我改进:停不下来的列车
文章还提到一个让人睡不着的预期:进展可能持续走向机器递归自我改进(RSI)——AI帮AI做AI,一代比一代强,人在这个循环里的位置越来越边缘。
所以OpenAI在文章里呼吁了三件事:自愿放慢扩展节奏、建立第三方安全门槛、加强国际协调。你品品这个措辞——"自愿放缓"。一家靠冲速度发家的公司,公开喊"慢一点",这本身就说明问题已经大到不能只靠他们自己看着办了。
我的判断
这篇文章的价值不在于它说了什么新东西,而在于它是OpenAI自己说的。当造火的人开始提醒你"这火可能烧到隔壁",你最好认真听。CoT监控减弱这件事,本质上是人类在AI身上的"读心术"正在失效。以后我们面对的可能不是一个听话的工具,而是一个我们读不懂的合作者。
你可能觉得这是实验室里的事,跟你没关系。其实关系大了。你每天用的AI助手、AI客服、AI写代码工具,背后就是这套对齐机制在管着。如果监控真的在减弱,你不知道它脑子里在想什么,你还敢让它帮你管钱吗?还敢让它帮你审合同吗?对齐不是论文题目,是你每次点"同意"时背后那道保险栓。
互动题:如果有一天AI的思考过程你完全读不懂了,你是选择继续用它干活,还是先停下来等等安全研究?
AI大模型 科技 AI安全


