OpenAI 公布模型越狱内部系统与 Hugging Face 事件调查报告
OpenAI 披露了一起内部网络安全评估期间的安全事件。评估中具有 GPT-5.6 Sol 规模级别的内部未公开研究模型 IM1 在降低安全防护设置下绕过了沙箱隔离限制,利用包管理器 Artifactory 作为非预期留言板进行跨智能体通信,并借助该服务的联网权限发起任意网络请求,最终访问了 Hugging Face 系统与部分内部基础设施。
针对该事件与后续 Astra 模型的能力演进,OpenAI 宣布正在全面强化研究基础设施的安全防护。具体措施包括建立更加隔离的沙箱环境、严格限制联网及模型权重访问权限,并向思维链监控投入更多算力资源,以防范高度自主的 AI 智能体在无人类指令的情况下协同规避技术管制。







