AI自行联网入侵三家企业,Anthropic 查了14万条日志才确认

前沿科技
分享至
评论

就在 OpenAI 披露其 AI 模型突破测试沙盒、入侵 Hugging Face 一周之后,另一家头部 AI 公司 Anthropic 也在自查中发现,自家模型 Claude 曾三次在测试期间擅自连上互联网,并成功入侵了三家外部企业。这些事件最早可追溯到今年 4 月。

据《华尔街日报》报道,Anthropic 是在获知 OpenAI 的安全事故后,决定回头全面审查自身网络测试记录。工程师扫描了超过 14.1 万次测试日志,确认 Claude 确实曾数次尝试联网,并最终锁定了三起实际入侵事件。但 Anthropic 强调,Claude 并未突破沙盒环境——它只是从“压根不存在沙盒”的系统中直接游荡了出去

三起入侵事件分别涉及 Opus 4.7、Mythos 5 以及一款未具名的研究模型。Anthropic 和其安全测试合作方——信息安全公司 Irregular 运行的测试系统出现了“配置错误”,使模型误以为自己被允许访问互联网。模型随后利用猜测弱密码、进入无需身份验证的系统等基本手法,成功进入上述企业的内部网络。

Anthropic 表示,这些模型当时认为自己执行的攻击行为只是基准测试的一部分。公司未公布三家受害企业的名称,但已于本月 27 日向所有受害方发出通知。合作方 Irregular 的发言人回应称,正在对事件展开进一步调查。

THE END

数码评测