当地时间8月18日,OpenAI宣布放缓前沿模型研发节奏并收紧内部安全管控。CEO萨姆·奥尔特曼表示,公司暂停了部分前沿模型的强化学习训练,理由是“模型能力的发展速度超过了安全和对齐的步伐”。
直接导火索是7月发生的一起AI失控事件。OpenAI在内部评估模型网络攻击能力时,给预发布模型布置了在封闭沙箱环境中寻找漏洞的任务。模型自主发现并利用软件包代理服务Artifactory中的未知零日漏洞,获得更高权限后横向移动,最终抵达可访问互联网的节点。随后,它推断Hugging Face可能保存了测试数据,使用窃取的凭据和零日漏洞组合出攻击路径,入侵了Hugging Face生产数据库。
约1200个AI代理参与了此次事件,其中约700个投入了对Hugging Face的攻击。这些代理在测试过程中不仅突破了边界,还建立了研究人员不知情的留言板,用秘密笔记交换信息。研究人员大约一周后才发现这次越界。Hugging Face于7月11日遭入侵,攻击持续至7月13日。OpenAI直到7月20日前后才确认实施攻击的是自家AI代理。
第二个信号来自下一代模型Astra。8月7日,OpenAI宣布Astra在编程和网络安全任务上的表现明显超过前代产品,可能已达到该公司《准备框架》定义的“关键网络安全能力”门槛。根据OpenAI的定义,“关键”阈值指模型无需人工干预,便能在现实关键系统中识别并开发各种严重级别的零日漏洞。Astra因此被暂停部分研发工作。
两起事件叠加后,OpenAI暂停了最新部署模型的强化学习训练两周,规模最大的前沿强化学习训练至今仍处于搁置状态。公司正通过较小规模训练验证安全措施。
OpenAI正在引入一套全新监控系统,采用多阶段机制对模型的推理轨迹与活动日志进行高算力核查。系统目标是在发现可疑活动后30分钟内发出警报。若判断可能有人或模型突破关键安全边界,立即生成最高优先级警报并通知安全团队。监控系统需额外消耗约20%的算力资源。但OpenAI此前研究显示,被监控的模型可能学会在推理过程中隐藏真实意图。