9 月 6 日,OpenAI 发布了一份内部研究报告:按公司的测量,他们已经实现了“自动化研究实习生”的目标。
这里的“实习生”,指能在人类指导下完成明确研究任务的 AI 系统。其中一些任务,熟练研究员也需要几天才能完成。
报告前三部分,讲了它们已经在做什么。
① Agent 已经进入研究员的日常工作
研究员越来越多地同时运行多个 Agent。截至 8 月中旬,研究团队每个人工工作日,对应约 3.1 个 Agent 工作日。
这个数字统计的是运行时长,不能直接换算成生产力。人仍然负责确定研究方向,判断哪些想法和结果值得继续。
② 代码更多,实验也更多
代码改动量和每位活跃实验者的实验数量都在增加。
但 OpenAI 提醒,代码和实验增加,不能直接等同于整体研究进展。同期可用算力也在增长,不能把变化全部归因于 Agent。
③ 交给 Agent 的工作越来越复杂
除了写代码,技术答疑、实验运行监控等用途也明显增加。高层规划仍只占 Agent 输出的一小部分。
预计人类需要 4—8 小时的任务中,43% 无人工干预成功,45% 经干预成功。也就是说,在成功任务中,超过一半仍有人介入。
以上为 OpenAI 内部测量。成功与干预统计覆盖 1—7 月,并排除了结果不确定的任务。配图参考官方图表作漫画改绘,趋势线并非逐点复刻;最后一张选取三个时长档,将失败、工具错误等归入“其余结果”。
来源:OpenAI《Research acceleration: The view inside OpenAI》
https://openai.com/index/research-acceleration-view-inside-openai/
#OpenAI #人工智能 #AI工具



