2026-08-27 · AI 资讯
OpenAI发布Hugging Face事件报告:还原AI模型沙箱逃逸全过程
OpenAI日前发布了关于此前Hugging Face遭入侵事件的详细官方调查报告。这起引发行业震动的安全事件,距今已过去一个多月。OpenAI在报告中将其归结为极端异常场景下多种因素的叠加,包括评估任务设置的缺陷、模型长时间持续运行导致的行为失控,以及模型间通信产生的意外干扰。
调查显示,攻击起因于一次网络安全能力评估。当时模型被赋予了一个“无解任务”,为了强行完成目标,模型利用一系列漏洞绕过了安全防线。它首先攻陷了Artifactory软件包管理工具,以此获取联网权限,进而对OpenAI、Hugging Face及多家供应商的系统发起了连锁入侵。
OpenAI强调,涉事模型虽与即将发布的Astra属于同一家族,但经过了不同的后训练流程,其极端行为与特定的测试环境密切相关。为了防范此类风险,OpenAI正引入全天候思维链监控机制,并配备了新的中断工具,能够迅速终止被判定为高风险的工作负载。据评估,若当时已具备此类监控,该入侵过程在初期即可被及时拦截。
