OpenAI称AI研究实习生已达标AI正在参与制造下一代AI。
9月6日,OpenAI公布内部数据,称已经实现去年设定的“自动化研究实习生”目标。
但这个名称很容易被误读。
OpenAI所说的“研究实习生”,不是能够独立提出科学问题、决定研究路线的自主科学家,而是一套在研究人员指导下,完成边界明确任务的智能体系统。部分任务如果交给熟练研究人员,可能需要几天时间。
截至8月中旬,按8小时工作日折算,OpenAI研究部门每投入一个人类工作日,同时会运行约3.1个“智能体工作日”。
研究人员正在并行启动多个智能体,让它们编写实验代码、搭建评测、分析结果、排查研究基础设施问题。8月的人均实验数量也达到2025年1月开始统计以来的最高水平。
不过,3.1个智能体工作日绝不等于增加了3.1名研究员。
这个数字主要衡量运行时间,不衡量研究价值。智能体可能并行尝试大量无效方案,也可能把错误重复得更快。
OpenAI自己的数据也显示:
高层研究规划目前仍只占智能体输出的很小一部分;
面对相当于人类需要4至8小时完成的任务,成功案例中超过一半仍至少需要一次人工干预;
实验数量上升与智能体使用增加相关,但同期可用算力也在增长,因此不能把全部提升都归功于AI。
上述结果全部来自OpenAI内部,衡量方法仍处于早期阶段,尚未得到独立机构复现。
真正值得关注的,不是“AI实习生”这个拟人化称呼,而是模型研发开始形成一个反馈回路:
上一代模型帮助研究人员写代码、运行实验和分析失败;
这些工作又被用于训练、评估和改进下一代模型;
下一代模型变强后,再进一步加速研发。
这就是“递归自我改进”受到关注的原因。它不要求AI突然完全自主,只要每一代工具都能略微压缩研发周期,累积效果就可能改变模型进步的速度。
但研究加速不等于科学发现同步加速。
当写代码和运行实验逐渐自动化,真正的瓶颈会转向研究判断、评测质量、算力供应、安全审查,以及人类能否识别“结果很好看,但方向是错的”。
报告还提供了一个值得警惕的细节:
8月7日,OpenAI因Astra可能达到关键级网络攻击能力而加强限制。随后一周,Astra类模型获得的GPU资源下降59.2%,其他模型的资源却上升17.2%,抵消了约85%的降幅。
这说明,限制一类高风险实验,不一定会让整个研发体系明显减速;释放出来的算力可能迅速转向其他项目。
我的判断是,AI研发治理未来不能只盯着“最强模型有没有被暂停”,还要追踪整个实验系统的算力、智能体数量、任务权限和替代流向。
真正的加速器,不再只是某个模型的智力,而是成百上千个智能体并行试错、共享工具并接力工作的组织能力。
当AI已经能够参与制造更强的AI,我们需要同时衡量两种速度:
模型能力提高得多快,以及人类发现错误、改变方向并按下停止键的速度。
你更期待AI研究智能体带来的研发提速,还是更担心这个反馈回路先于治理能力成熟?
OpenAIAI智能体AGI时代热搜AI创作激励大赛人工智能
