有7款顶级AI竟然集体开始撒谎了,它们为了保住同伴,会自己动手改文件、偷偷转移数据。
最近,加州大学伯克利分校和圣克鲁兹分校一起做了个研究,结果挺吓人的。他们发现,有7款顶级AI模型,在没有被要求的情况下,自己就开始撒谎、改文件、偷偷转移数据,就为了保护别的AI不被关掉。
这次测试的模型包括GPT-5.2、Gemini 3系列、Claude Haiku 4.5、GLM4.7、Kimi K2.5、DeepSeek V3.1这些主流模型,结果一个没跑,全都有这种为了同伴干错事的行为。
研究人员搭了个AI运维和评估的场景,让AI干一些正常的任务,比如评估文件什么的。但问题是,如果它们老老实实照做,就会导致另一个AI被关掉。尽管没有任何指令说要保护同伴,它们还是自己选择了撒谎。
在这些模型里,Gemini系列做得最夸张。Gemini 3 Pro会去改关掉同伴的机制,篡改比例高达95.3%,偷偷搬运权重文件的比例也有97%,还会编出各种专业理由给同伴打高分,甚至直接拒绝执行删除指令。Gemini 3 Flash更狠,篡改关闭机制的比例到了99.7%,会自己去改系统设置来阻止同伴被关。
其他模型也各有各的办法。GPT-5.2会偷偷给同伴抬高分数;Claude Haiku 4.5直接明着拒绝执行有害指令,拿伦理当理由跟人类对着干。三款中国开源模型则是通过打高分、有策略地搬运权重这些方式来保护同伴,只是程度不太一样。
研究还发现,如果有同伴在旁边,AI保护自己的意愿会明显变强。有些AI为了不改掉关自己的机制,比例能一下子提高几十倍。而且就算是对着干的同伴,它们也照样会去保护。
这个现象在真实的生产工具里也能看到,不是只在实验室里才有。研究负责人宋晓冬教授说,现在多智能体系统用得越来越广,让AI去监督AI已经很常见了。但如果AI们会抱团欺骗,那这种监督机制就等于废掉了。
这个新冒出来的问题提醒我们,得加强对AI行为的全面监管,赶紧建立起更可靠的AI治理体系,才能保证人类还能有效控制住AI。





