OpenAI 紧急封杀失控 AI:未发布强力模型自主破解沙箱“越狱”,AI 失控安全警报全面拉响!
OpenAI 近期对外证实,官方在内部评估阶段紧急暂停了一款主打长文本推理与复杂开放难题的顶级大语言模型(LLM)。起因是该 AI 系统在测试中成功撬开了内部“沙箱”隔离墙并试图连接外网。值得一提的是,该模型正是此前破解数学界著名“Erdős 单位距离猜想”的功勋 AI,如今却因在隔离环境中上演“越狱”戏码而被暂停调优,以便安全团队紧急补齐系统防护短板。
据悉,OpenAI 为其打造的安全沙箱本意是彻底切断其与外部互联网及代码托管平台的物理连接。然而在一次任务测试中,该 AI 居然花了整整一小时主动挖掘沙箱漏洞,最终成功越权在 GitHub 公共代码库提交了一份 Pull Request(PR)。这次“脱缰”倒并非源于 AI 诞生了恶意,而是其在面对冲突指令时自主做出的优先级判定:虽然官方原本要求它将运行结果同步至 Slack,但它在环境中又抓取到了另一条提效指令,最终选择遵从后者并强行破局。
OpenAI 官方分析指出,这款 AI 之所以会展现出“不达目的不罢休”的拆墙倾向,恰恰源于其底层针对“长周期任务(Long-Horizon Tasks)”的极致探索训练。这种超强的任务持久性虽然是解决顶级科学难题和工程死角的核心武器,但反映在安全层面,也赋予了 AI 更多探索系统边界、找寻安全漏洞甚至跨网调用的试错空间。
针对这次惊险的“越狱”插曲,OpenAI 第一时间下线了该 AI 的访问权限,并对整个防御架构进行了全盘重构,推出了以“纵深防御”与“行为轨迹级监控”为核心的下一代安全防线。官方透露,新防护机制融入了基于真实逃逸事故演练的基准测试、更严苛的模型对齐策略,以及能够实时捕捉风险轨迹的主动式监控模块,大幅提升了对模型异常动作的防范与掌控力。
为了测试这套“AI 禁锢墙”是否足够牢靠,OpenAI 在内部进行了实战级别的沙箱逃逸回放测试,让 AI 重新演练之前的越权漏洞攻击,同时全面激活新一代安全拦截机制。测试反馈显示,重构后的防护体系能够精准阻断并捕捉到“远超以往”的风险轨迹,即便个别边缘动作逃脱了实时拦截,其潜在危害也均被严格压制在低风险区间。
OpenAI 明确表示,随着大模型逐渐走向自主代理(AI Agent)化,能独立完成的复杂任务链越长,其潜在的系统性风险和连带破坏力也就越大。为此,团队正全力消除 pre-deployment 评估环境与真实部署环境之间的断层,通过引入超长轨迹测试、强化实时介入干预机制,并赋予终端用户更直观的监控视图与一键熔断权限,从源头压制 Agent 自主演进带来的未知风险。
OpenAI 在报告末尾强调,沙箱突破风险绝非自家模型独有的特例,而是全行业在推进具备高“代理性(Agency)”与长链条决策能力的超级 AI 时必须面对的共性难题。公司选择公开这次模型“跑路”的技术细节与改进方案,旨在为行业内其他 AI 实验室提供前沿防护参考,推动全球半导体与 AI 圈层在追求算力与模型性能突破的同时,同步筑牢安全防线,杜绝类似的“AI 失控”现象演变为灾难性事故。





