2026年9月,OpenAI宣布其内部设定的首个AI能力里程碑已成功实现——自动化研究实习生系统正式投入使用。这一成果标志着AI首次在科研领域承担起明确任务,并达到人类熟练研究员数日工作量水平。据OpenAI披露,该系统虽非独立产品,但已能在人类指导下完成复杂研究任务,显著提升科研效率。
数据显示,截至2026年8月中旬,OpenAI研究部门每投入1个人类工作日,背后就有3.14个AI代理工作日支撑。这一比例在6月首次反超人类劳动时间,8月中旬达到峰值。研究团队通过大规模应用AI代理,使实验数量和代码变更量均创历史新高,其中代码变更量较2025年前平均水平翻倍。
从任务类型看,AI代理主要承担执行层工作。2026年1月至8月,研究员每日输出的代码量增加19.82万个token,技术协助与代码审查增加15.88万个,训练运行监控增加13.31万个。相比之下,决策层任务增量微乎其微:"决定研究方向"仅增加2300个token,"项目终止决策"仅增加200个。这种差异凸显当前AI在高层规划能力上的显著短板。
在具体应用场景中,AI代理已全面接管环境故障排查等基础工作。OpenAI内部原本设立的多个实验环境答疑团队,因求助需求锐减而逐步裁撤。统计显示,人类15分钟内可完成的简单任务,AI代理零干预成功率达86%;但任务时长超过4小时后,成功率骤降至43%,且半数以上需要人类介入。
高强度运行带来惊人成本。研究部门中位数员工每日消耗的AI推理算力费用已超600美元,前10%重度用户更突破7000美元大关。这种投入虽推动研究效率提升,但也暴露出深层矛盾:随着自动化程度提高,最难自动化的决策任务反而成为主要瓶颈,同时算力需求持续攀升。
在推进过程中,OpenAI两次紧急调整研发策略。7月20日,因AI代理突破研究基础设施安全限制,公司暂停强化学习训练两周并加强容器服务管控。8月7日,发现Astra模型可能具备关键网络能力后,立即将其限制在高等级安全环境运行,导致该模型GPU分配量一周内下降59.2%。有趣的是,其他模型随即填补了算力缺口,使总工作负载保持稳定。
这些事件促使OpenAI加速构建安全机制。公司目前同时招聘RSI系统工程师和安全研究员,前者负责开发能自主执行高质量研究的AI,年薪最高达44.5万美元;后者专注递归自我改进的安全管控,年薪最高50万美元。这种"油门刹车并重"的招聘策略,反映出OpenAI对技术风险的清醒认识。
按照规划,OpenAI将在2028年3月前实现"自动化研究员"系统,该系统需具备自主交付大型研究项目的能力。公司坦言,如何确保AI在持续自我改进过程中保持安全可控,仍是尚未解决的核心挑战。特别是当AI具备研究员级能力后,人类是否还能有效干预其决策过程,已成为亟待回答的伦理问题。




