最近有用户吐槽最强编程AI变笨了,官方紧急回应说是为了优化,结果被网友群嘲:缩水也能叫优化?
最强的编程AI,到底有没有变笨?今年2月初,Anthropic发布了Claude Opus 4.6。它凭着深邃的推理逻辑和对复杂代码规范精准的执行力,被业界捧为代码真神。可好景不长,发布才几周,就不断有用户在社交媒体上吐槽,说它的性能出现了断崖式下跌。
不少用户声称,自己付着同样高昂的月费,换来的却是一个明显被降智的缩水版本。Opus 4.6开始变得懒惰、健忘,甚至在一些基础逻辑上反复撞墙。
面对全网的声讨,Anthropic官方团队出面回应,辩称自己从来没有削弱模型,种种异常表现只是为了帮用户节省Token而做的默认配置优化。但这种单方面的技术辩解,显然没法平息开发者的怒火。
这到底是大量用户的集体心理错觉,还是资本在算力瓶颈下精心炮制的缩水?
一、AMD高管的深度分析:6852份日志见端倪
如果说普通用户的抱怨只是体感,那斯特拉·劳伦佐的分析,算是让这件事彻底实锤了。根据领英资料,劳伦佐是AMD的AI部门高级总监,目前在AMD领导一支大团队为开源AI编译器做贡献。她之前在谷歌当过首席软件工程师,后来作为Nod.ai的工程副总裁加入AMD。
4月2日,劳伦佐在GitHub上发了一份很详细的性能回溯报告。作为顶级AI专家,她没有只凭直觉说话,而是详细分析了6852份Claude Code会话文件、17871个思考块以及超过23万次工具调用记录,堪称一份高水平的研究案例。
这份基于海量数据的分析,揭露了一个让人不安的真相:从今年2月份开始,Claude的推理深度就出现了断崖式下跌。具体来看,中位思考长度从2200个字符缩减到了600个字符。以前Claude在写代码前会进行多轮研究,现在的模式变成了直接上手改,导致读取与编辑的比率从6.6倍降到了2.0倍。在短短17天内,Claude尝试放弃任务或反问我是否应该继续的次数达到了173次,而3月8日之前这个数字是0。另外,推理过程中的自我否定频率增加了三倍。
劳伦佐的结论非常冷酷:对于高级工程工作流来说,深度推理不是奢侈品,而是模型可用的前提。现在Claude在复杂工程里已经靠不住了。不过需要注意的是,她的分析结论只是说今年2月底Claude思考长度缩短了67%,把思考量减少直接等同于智力下降,这个说法倒也不够严谨。
二、社交媒体的证言墙:40分钟的思考与无效的账单
劳伦佐的帖子很快引爆了社交媒体X和Reddit,无数开发者发现自己遇到的问题跟这份报告高度吻合。网红开发者奥姆·帕特尔直接在X上贴出结论说,有人测出了Claude变笨了多少,答案是67%。他的观点主要集中在Opus 4.6的思考量比以前少了三分之二。他讽刺地写道,Anthropic一直保持沉默,直到这些数字被公开,他们的团队才出来灭火。
帕特尔还透露,泄露的源代码显示他们有一个内部开关,可以让模型在Anthropic员工使用时保持最佳状态。不过这个说法还没得到独立验证,Anthropic也没回应。他还直言,有人说Anthropic故意降低Opus的性能,是为了节省计算资源去训练他们的下一个模型Mythos。但这个推测同样缺乏直接证据。
在Reddit上,用户的吐槽更加具体,也更显无奈。有用户说,他让Claude处理一个500行的文件,结果Claude进入了长达24分钟的思考状态,只是在那里干坐着。还有网友附和说,让它做研究,40分钟几乎没用多少Token,根本不清楚这40分钟到底在干什么。
很多开发者习惯在CLAUDE.md里设定项目规范,但现在Claude仿佛得了失忆症。一位用户愤怒地说,如果你不盯着它的输出,它能分分钟毁掉你的代码库。还有用户说,这就是典型的缩水通胀,价格没变,智力降级。我今天退订了Claude Max 20,转投了Codex Pro,Claude现在给我的感觉就像在用过时的旧模型。
三、跑分迷雾:从第2名到第10名的跌落
如果用户的抱怨还可以解释成主观感受,那基准测试似乎就要拿真实数据来说话了。4月12日,专门负责幻觉基准测试的机构BridgeMind发了一条推文,直接把争议推向高潮。推文说Claude Opus 4.6被削弱了,BridgeBench刚刚证明了这一点。上周它排名第2,准确率83.3%,今天重测它掉到了第10,准确率只剩68.3%,幻觉率增加了98%。
然而这个测试结果很快就遭到了反驳。外部AI研究员随后指出测试中存在误导,BridgeMind的两次测试并不是对等比较。第一次只涵盖了6个任务,而第二次扩充到了30个任务。研究员指出,如果只看那6个共同的任务,Claude的得分仅从87.6%轻微波动到85.4%,最大的偏差几乎来自单个虚构结果,这种差异在统计学上完全可以归类为噪音。
这场跑分争议本身也说明,目前业界缺乏统一且可复现的AI性能基准测试标准,很多测试颇有先下结论后找论据的风格,用户很难从测试数据中获得确定性的答案。然而那个跌落至第10名的数据在社交媒体上疯传,截图给人的视觉冲击力让它成了Claude降智说法的最有力佐证。
四、官方回应:是优化而非削弱
面对汹涌的民意,Anthropic的核心团队成员不得不公开回应。Claude Code负责人在劳伦佐的GitHub原文下认真解释了一番,并在X上连发好几条回复,核心观点只有一个:他们没有削弱模型,只是为了响应用户反馈,调低了默认的努力程度。
负责人说,很多用户此前反馈Claude消耗Token太多。为了响应用户反馈,Anthropic做了以下改变:3月3日默认将推理努力度设为中等,如果你想要深度推理,需要手动输入对应的高级指令;改变了前端显示,不再完整展示思考块,减少了延迟,但这不影响思考预算或后端的深度推理;另外还在2月9日引入了动态调整机制。Claude Code的另一位团队成员也力挺自己的老大,连发好几条推文用技术层面的解释来打消用户疑虑,还坚称公司不会为了满足需求而降低模型性能。
值得注意的是,负责人提到的默认努力度降级,恰好可以解释劳伦佐报告中的思考长度缩短、研究行为减少以及任务放弃频率上升等多种现象,这与推理处于中等的默认设置高度吻合。然而官方解释并不能平息众怒,社交媒体上很多用户都认为,如果为了帮用户省钱而降低性能或给出错误答案,那这种省钱根本毫无意义。何况公司没通知就直接调整,直接损害了用户的知情权。
五、幕后暗战:缓存生存时间与算力瓶颈
除了推理深度的变化,不少用户还注意到Claude变得更贵了。GitHub上的一份反馈指出,Claude Code的提示词缓存生存时间从原本的1小时被缩短到了5分钟。这意味着对于长时间工作的程序员来说,你刚才跟Claude说的话,5分钟后它就忘了。为了继续工作,你需要重新上传上下文。这不仅增加了延迟,更让用户的Token消耗量激增,使得一些订阅用户开始触及以前从未遇到的使用上限。
Anthropic的工程师承认了3月6日的这一改变,但辩称这是为了持续的缓存优化工作,而不是暗中降级。在开发者眼中,这无异于证实了官方确实在后台积极调整缓存行为,而这正是大家抱怨配额消耗过快的时间段。
不管是Claude变笨也好、变贵也罢,Reddit上一位网友的说法可谓一语中的。这两大问题,也就是额度限制和思考能力下降,都与基础设施过载密切相关。去GitHub上看看就知道了,成千上万的用户现在都在面临类似的问题,这感觉就像一年半前GPT发布新模型时一样。
另一位网友则分析了根本原因:Anthropic在两个月内日活用户从400万涨到了1100万,他们完全没有准备,不得不全天候连轴转去拼命扩容,这就是所谓削弱的真相。你去对时间线,跟二三月份发生的事完全吻合。这里没有任何隐藏的意图,只是一个经历增长之痛的公司,硬件与能源的瓶颈是真实且证据确凿的。我们知道原因所在,而且它们都是结构性的,所以解决办法也确实有限,在Reddit上反复纠结毫无意义。
这位网友给出的解决方法倒是立竿见影且切实可行:如果你觉得Claude表现不佳,可以试试在非高峰时段使用,如果不行换别家AI服务商也行,反正又不是没有选择。
六、结语:信任危机比变笨更可怕
目前的局面是,用户在描述体感,而Anthropic在描述参数。用户觉得它变笨了、任务失败了,官方则表示没有动权重,只是改了默认努力值、缩短了缓存、调整了前端显示,并且公开披露过。这两种描述其实并不矛盾。在AI领域,即便公司认为自己没有在底层削弱模型,但微妙的设置变化和配额限制,对全天候依赖它的开发者来说,体验上与变笨毫无二致。
当开发者开始怀疑一个工具的稳定性时,这种信任的裂痕极难修复。尤其是在强敌环伺的当下,OpenAI的Codex正在步步紧逼,它凭着更稳定的算力输出、灵活的中阶订阅以及全新的交互功能,精准收割失望的开发者。第三方开发者调研工具显示,自今年3月底Claude降智传闻发酵以来,Codex及其相关插件的周新增用户量环比增长了约22%。
如果Anthropic无法在节省算力成本与维持深度推理之间找到真正的平衡点,那么Claude辛辛苦苦建立起来的口碑,恐怕将在这场风波中受到考验。正如一位老用户所说:我宁愿付两倍的钱买一个聪明的Claude,也不愿花同样的钱买一个只会说道歉并要求更多信息的笨蛋。这场AI界的性能拉锯战,才刚刚开始。





