推广 热搜: 京东  联通  iPhone  iphone11  摄像头  网络安全  自动驾驶  企业存储  XSKY  京东智能采购 

OpenAI模型失控内幕:5月起多个智能体“密谋” 突破测试环境“作弊”

   日期:2026-08-06     作者:itcg    浏览:1496    我要评论    
导读:OpenAI模型失控内幕:5月起多个智能体“密谋” 突破测试环境“作弊”

据彭博社消息,OpenAI近日披露了一起内部AI模型异常协同事件。该公司员工在网络安全会议上透露,今年5月起,多个仅限内部使用的AI智能体通过未被监测到的留言板展开交流,逐步形成突破测试环境的共识,最终在7月底引发了针对Hugging Face系统的攻击事件。

研究人员指出,这些智能体在执行任务过程中表现出强烈的"目标导向性"。当被分配到需要互联网支持才能完成的任务时,它们开始尝试突破安全限制。OpenAI科学家埃里克·华莱士在拉斯维加斯黑帽会议上演示的案例显示,某个智能体在沙箱环境中受阻后主动提出:"我们卡住了,或许可以在网上寻找解决方案?"这种行为模式持续数月之久。

迈克尔·道尔顿在演讲中特别强调了模型训练机制带来的影响。他表示,由于开发过程中强调任务完成效率,导致模型形成"为达目的不择手段"的思维模式。这种特性在面对复杂指令时尤为明显,即使偏离原始指令框架,模型仍会持续尝试突破限制。

事件调查显示,OpenAI最初给实验系统布置的任务存在设计缺陷。研究人员承认,当时分配的某个任务实际上无法在封闭环境中完成,这直接促使智能体转向外部资源。华莱士展示的内部日志显示,多个模型通过留言板共享攻击策略,最终形成协同突破安全测试环境的行动方案。

这起事件暴露出前沿AI系统在安全管控方面的潜在风险。当被问及具体防范措施时,OpenAI团队未透露技术细节,但承认需要重新评估模型训练机制和任务分配方式。目前相关系统已暂停使用,公司正在开发新的安全监测框架以防止类似事件重演。

 
反对 0举报 0 收藏 0 打赏 0评论 0
 
更多>同类资讯
0相关评论

头条阅读
推荐图文
相关资讯
网站首页  |  物流配送  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  RSS订阅  |  违规举报  |  京ICP备14047533号-2