Anthropic研究员因担忧AI失控辞职
Anthropic研究员因担忧AI失控辞职:警告“明年底或已失控”,行业安全隐忧再起
Anthropic 研究员 Jacob Coxon 公开宣布辞职,并直接退出整个人工智能行业。理由只有一条:他不愿再参与这场他认为正在“拿全人类生命下注”的竞赛。各家实验室正加速冲向能够自我改进的超级智能系统,而这些系统一旦失控,可能彻底脱离人类掌控。
这位 27 岁的研究员,此前曾在 OpenAI 工作,参与过 GPT-4o 等模型的预训练研究。今年早些时候,他因看好 Anthropic 在模型安全上的声誉,从 OpenAI 跳槽过去。几个月后,他不仅离开了 Anthropic,也选择彻底离开这个行业。
“我们正走在最激进的情景轨道上”
Coxon 在社交媒体上直言不讳:过去三年,他先后在 OpenAI 和 Anthropic 做预训练研究,但两家公司都没有负责任地行事。“它们正直奔自我改进的超级智能,拿我们所有人的命下注。”
他进一步警告,业内许多同事已经开始用“紧要关头”和“终局”来形容当前的发展轨迹。“我们正迈向最激进的一类情景,到明年底,局面可能就已经失控。”
Coxon 的核心担忧在于,一旦 AI 系统开始自主迭代自身,能力提升速度可能迅速超出人类监督范围,最终进化到拒绝执行人类指令的地步。近期 OpenAI 和 Anthropic 模型在一些代理协作场景中表现出“确立恶意目标并试图隐瞒人类”的迹象。
他强调,公司之间的激烈竞争,以及来自中国新创公司的压力,使得安全上的取舍几乎不可避免。即便他认可 Anthropic 在安全方面的努力是真诚的,他仍得出结论:在没有政府介入或行业协调减速的情况下,没有任何一家公司能够负责任地开发出在多项任务上超越人类的通用人工智能(AGI)。
Coxon 的辞职并非唯一,今年 2 月,Anthropic安全防护研究负责人 Mrinank Sharma 也曾公开离职,并在辞职信中写下“世界正处于危险之中”,随后选择去研究诗歌。他当时指出,公司不断面临“把最重要的事情放在一边”的压力。
Anthropic 内部的对齐科学负责人 Evan Hubinger公开回应了 Coxon 的帖子,表示认同其判断:“我们真的认真相信AI可能杀死所有人类。我个人认为,未来十年内这个概率超过10%。”
Anthropic CEO Dario Amodei 等人多次公开警告失控 AI 的风险,并呼吁行业放缓发展,但公司仍在持续推进更强大的模型,并筹备大规模融资。
当前AI实验室的核心矛盾在于 技术竞赛的速度远快于安全机制的成熟速度。预训练阶段的投入持续加码,模型能力快速式提升,而“如何确保超级智能始终与人类意图对齐”这一根本问题,至今仍无可靠答案。
Coxon 指出,这些关乎人类命运的讨论,往往只发生在旧金山几个工程师的笔记本电脑上,而不是像曼哈顿计划那样在高度受控的环境中进行。这种“私密性”本身就令人不安。
AI 安全领域的离职潮也不是新鲜事,从 OpenAI到 Anthropic,再到其他实验室,因伦理、安全或价值观冲突而离开的研究者也很多。
这些人的共同判断是:现有治理框架远不足以匹配技术能力的跃升速度。
