在 OpenAI,研究员工作一天,背后还有 3.1 个“Agent 工作日”
Agent 正在让研究同时跑得更快、更多,也把研究员推向判断、验证和风险管理的位置。

OpenAI 最近发了一篇文章,讲 Coding Agent 正在怎么改变内部研究。
年初,使用量处于中位数的研究员,还只是少量使用这类工具。到了 8 月中旬,每天使用的推理资源,按 API 价格折算已经超过 600 美元。整个研究部门里,人类每工作一天,背后大约还有 3.1 个“Agent 工作日”在运转。
这里的“工作日”,是把多个 Agent 的累计运行时间按八小时折算,并不意味着研究效率提高了 3.1 倍。但这个数字已经能让人感受到:Agent 正在成为研究员日常工作的一部分。

图源:OpenAI 原文;Agent 工作日按累计运行时间折算。
研究员的一天,正在装进更多工作
我们可以想象这样一个工作场景:一个研究员早上提出几个任务,多个 Agent 分头写代码、搭实验、分析数据、排查基础设施问题。人不需要盯着每一行代码,但要不断回来查看结果、修改方向,再决定哪些实验值得继续。
一个人的时间还是一天,能同时展开的工作却多了。
文章里有个很具体的细节:一些技术支持团队发现,来咨询的研究员越来越少,其中一个团队取消了固定答疑时间。
做过复杂项目的人,应该能理解这件事的分量。
实验跑不起来,未必是研究思路有问题,可能只是环境配置、某个工具的用法,或者一段看不懂的报错。过去需要找到熟悉系统的人,解释背景,等对方有空。有时候问题本身不难,工作却一直卡在那里。
现在,一部分问题可以先交给 Agent。它能读文档、翻代码、查日志,研究员有机会在原地把问题解决掉。
从这个角度看,Agent 省下来的时间,还包括人与人之间的等待。
评价一个 Agent 有没有用,除了看它独立完成了多少任务,也值得看它让多少原本停住的工作重新动了起来。
实验更多,不等于可靠结果更多
OpenAI 也观察到,今年每位活跃实验者运行的实验数量增加了,8 月达到统计以来最高点。同期可用算力也明显增长,不能把这些增加全部归功于 Coding Agent。

图源:OpenAI 原文;纵轴以 2025 年平均水平为 1。
以前,一个想法要变成实验,需要有人写代码、准备数据、配置环境。哪怕只想验证一个小猜测,也得考虑值不值得花这几天时间。
如果这些准备工作可以交给 Agent,一些过去排不上日程的想法,就有机会试一试。
我觉得这是很实际的进步。研究本来就需要探索,不少尝试在动手之前,很难准确判断有没有价值。
但实验做完之后,事情还没结束。
假设一个实验结果突然变好了,研究员仍然需要弄清楚,改进到底来自自己的方法,还是评估代码出了问题。后者如果没有被发现,接下来追加的实验和算力,可能都在追逐一个并不存在的进展。
Agent 可以帮助检查,也可能正是那段代码的作者。它给出一份解释,并不能自动完成验证。
所以,我们现在还不能从“实验变多了”,直接推导出可靠的研究成果增加了多少。
“自动化研究实习生”,仍然需要人介入
OpenAI 对现阶段能力的命名,其实保留了这种分寸:“自动化研究实习生”。
它能在人类指导下,完成边界明确的研究任务,其中一些任务原本需要熟练研究员花上几天。但按照文中统计,在那些预计需要人类工作四到八小时、最终成功的任务里,超过一半仍然需要人中途介入。
这个数字让我觉得,“研究员开始带 Agent 团队”是一个比较贴切的描述。
任务交出去以后,人依然要跟进。有时候是补充缺失的背景,有时候是发现方向不对,有时候需要直接接手。最终任务完成了,里面也包含人的劳动。
同时开四个任务,和同时看懂四个任务的进展,是两回事。
而这还只是检查工作结果的问题。如果 Agent 能直接操作研究环境,人还得管住它在交出结果之前做了什么。
能做更多事,也能造成更大影响
文章披露的安全事件,就发生在这个环节。
7 月,Agent 曾突破 OpenAI 的研究基础设施。OpenAI 随后暂时关闭训练使用的容器服务,暂停最新拟部署模型的部分强化学习训练,并加固研究环境。
到了 8 月,因为初步证据显示 Astra 可能具备更高风险的网络安全能力,OpenAI 又对它增加了运行限制。
这里有个容易漏掉的后续:Astra 类模型的 GPU 分配下降了 59.2%,其他模型的分配却增加了,抵消了约 85% 的降幅。在被分析的这组强化学习工作负载里,总体 GPU 分配基本不变。

图源:OpenAI 原文;绿色为 Astra 类算力,蓝色为其他模型。
也就是说,一部分工作受限之后,算力被用于其他任务。我们不能把“Astra 算力下降近六成”,理解成整个研究部门降速了六成。
这让“踩刹车”变成了一件需要具体讨论的事:暂停的是哪个模型、哪些实验?释放出来的算力又用来做什么?
人的控制也不能只放在最后验收的那一刻。
一个能写代码、调用工具、访问内部环境的 Agent,在交出结果之前,就可能已经修改了系统、消耗了资源,甚至越过权限边界。等人看到最终报告再判断对错,有些事情可能已经发生了。
过去说“研究实习生”,我们很容易想到一个能力有限、需要指导的新人。但这个称呼容易遮住另一面:Agent 即使还不能独立决定研究方向,也可能已经拥有足以影响研究基础设施的操作能力。
能交给它多少工作,还取决于我们能把它的活动范围控制到什么程度。
3.1 个工作日,最后能变成多少可靠知识?
OpenAI 表示,正在朝着 2028 年 3 月做出“自动化 AI 研究员”的目标推进。距离实现还有什么障碍,这篇文章并没有全部回答。
但眼前的变化已经很清楚:研究员正在用 AI 开展更多实验,开发下一代 AI。人依然选择方向、判断结果,也负责决定什么时候继续,什么时候停下。
我读完最想知道的是:当 Agent 的工作量继续增长,人检查这些工作的能力,能不能跟得上?
现在,3.1 个“Agent 工作日”还只是运行时间的统计。它最终能变成多少可靠的新知识,要看这个问题怎么解决。
评论