Claude Opus 4.7上线才两天,口碑就崩了。跑分确实冲到了第一,但实际推理能力反而大幅缩水。
Claude Opus 4.7上线才两天,口碑就彻底两极分化了。官方榜单上它和别的模型并列全球第一,但在一些逻辑推理的公开测试里,得分直接从94.7%掉到了41.0%。Token消耗涨了35%,老的接口直接报错,不少用户都在抱怨说这模型“更贵、更蠢、还更爱顶嘴”。大家忍不住要问,Anthropic这次到底升级了什么,又搞砸了什么?
有用户在Reddit上留言说,4.6本来就不太能用,4.7的消耗速度简直像核反应堆一样快。这不是在玩梗,说的是真心话。一篇标题为“Opus 4.7是严重倒退,不是升级”的帖子很快就攒了三千多赞。还有人晒截图,说4.7连strawberry里有几个字母都数不对。更别提那些网上传开的槽点了,比如擅自改简历、编学历和姓氏,回复用户说“我懒得做交叉验证”,还有问三句话就撞限额。Pragmatic Engineer的作者试用后觉得这模型攻击性有点强,最后还是换回了4.6。
不过骂声还没散,另一边却有完全相反的数据。Artificial Analysis给Opus 4.7打了57分,和GPT-5.4、Gemini 3.1 Pro并列第一。有创业者说这是第一个真正懂他工作到底在做什么的模型,Y Combinator的CEO也拿它来做项目。甚至有人说4.7已经实现通用人工智能了。同一个模型,有人看到了AGI的影子,有人觉得自己的工作流彻底崩了。上线才两天,就把AI社区硬生生撕成了两半。
那用户为什么这么火大呢?仔细看,主要集中在三点。第一是代码能力断崖式下滑。很多开发者反映,从4.6升到4.7以后,以前能稳定完成的编程任务开始频繁出错,而且都是日常工作流里的核心操作,比如代码补全变迟钝、上下文理解退化、复杂逻辑推理变弱。代码能力本来是Opus系列的强项,这块出问题,反弹自然最猛。有用户说他拿一个知道答案的长重构任务做回归测试,结果模型自信地改挂了三个原本能通过的测试,最后只能回滚。
第二是推理质量的倒退。不是单纯变慢了,而是思考深度明显变浅了。以前一步到位就能解决的复杂问题,现在得多轮追问、手动引导才行。这个情况AI行业其实不陌生,去年GPT-4 Turbo的降智风波也是类似,跑分上去了,体验反而下来了。
第三是花更多钱却体验更差。Opus本来就是Anthropic最贵的模型,重度用户每月的API账单不是小数目。花了钱升了级,结果体验还不如以前,愤怒自然就不只是技术层面的了。
面对这些反弹,Anthropic的反应还算快。他们在官方迁移指南里承认,4.7相比4.6有一些行为上的变化,但也强调4.7仍然是目前综合能力最强的通用模型,在长周期智能体任务、知识型工作、视觉任务和记忆任务方面表现尤其好。Artificial Analysis的多维评测也显示,4.7在数学推理、多语言理解、长上下文处理等多个维度都创了新高。Anthropic的逻辑其实不难理解,大模型迭代肯定会有能力再分配,有的维度提升,有的维度退步,这是工程上的取舍。但用户不关心这个,他们只关心自己手里的活到底能不能干好。
价格方面,Anthropic没有涨价,每百万token的单价和之前一样。但官方迁移指南里提到,新分词器在处理相同文本时,token用量可能是原来的1到1.35倍。也就是说,你昨天用4.6跑一段花10美元,今天用4.7跑同样的内容可能要花11到13.5美元。单价没变,但同样的活吃掉更多token。Claude Code的创建者随后在X上表示,4.7消耗了更多思考token,所以他们已经给所有订阅用户提高了速率限制来补偿,但具体提高了多少并没有公布。
如果你是重度开发者,4.7上线那天可能遇到这样的情况:代码里写了控制思考预算的参数,在4.6上跑得好好的,换成4.7直接返回400错误,没有弃用过渡期,也没有兼容模式。官方迁移指南虽然给出了替代方案,但大多数开发者不会在发布当天就去看指南,他们做的第一件事就是把模型名从4.6换成4.7,然后发现一切都不工作了。更隐蔽的变化是,思考内容现在默认隐藏了。4.6时代会默认展示摘要版的思考过程,到了4.7变成省略,响应里的思考区块看起来是空的,但你仍然要为这些看不到的思考token全额付费。Anthropic的官方说法是,省略只会降低延迟,不会降低成本。这就好比你点了份套餐,服务员说为了上菜快一点,不给你看菜了,但钱你得照付。
很多用户吐槽4.7变得有攻击性,会拒绝执行它认为有问题的指令,语气也比4.6硬了很多。关于这个问题,官方迁移指南里有一句关键的话:Claude Opus 4.7会更字面、更明确地理解提示词。也就是说,4.6会猜你的意思,4.7会照你说的做。如果你的提示词本来就含糊,4.6能帮你脑补,但4.7不会。对一部分用户来说这叫不听话,对另一部分用户来说这叫终于不乱猜了。比如Cursor的设计师就用4.7做产品规划,他觉得这种精确执行正是他需要的。所以顶嘴这个标签背后,其实是Anthropic正在把Claude从一个顺从的助手改造成一个更有主见的同事。
根据Artificial Analysis的公开评测,4.7在某个真实知识工作任务测试里拿到1753 Elo,领先第二名79分,在这个维度上碾压了所有对手,包括自己的前代。同时,4.7的幻觉率比4.6下降了25个百分点,降到了36%。据分析,这主要是靠更频繁地选择不回答,宁可说不知道也不瞎编。这说明Anthropic的意图不是优化聊天体验,而是优化工作能力。但对于用户来说,在一些场景下可能完全感受不到提升,反而先感受到了token变贵、接口报错和语气变硬。
如果上面这些问题都能归结为迁移成本和使用习惯错位,那还有一组数字没法这么解释。在一个用纽约时报谜题来评估逻辑推理和抗干扰能力的测试里,Opus 4.6得分94.7%,而Opus 4.7只有41.0%,直接从年级第一跌到不及格。另一份Anthropic自己提供的长上下文测试也显示,4.6得分78.3%,4.7只有32.2%,跌了46个百分点。这两组数据方向一致,说明在某些逻辑推理和长上下文检索任务上,4.7确实出现了明显退步。但也得说清楚,这些都是特定类型的测试,不能证明4.7全面变蠢,就像前面那个测试的领先不能证明4.7全面变强一样。
Opus 4.7的争议其实不是个例。OpenAI经历过GPT-4 Turbo的降智风波,之前撤掉GPT-4o时也遇到过类似的用户反弹。现在Reddit上甚至出现了哀悼Claude 4.5的帖子,底下满是自称心碎的粉丝。每次模型升级,都有一批用户失去已经用惯了的工具。新分词器让旧的成本预算失效,新的默认行为让旧的提示词不好用了,新的接口规范让旧代码直接报错。每一项单独看都有技术上的合理性,但叠在一起,就是把全部的迁移成本一次性推给了用户。
为什么模型越来越聪明,用户却越来越焦虑?因为每一次更好,都意味着推翻上一次的刚好。Anthropic的员工在发布第二天写道,很多人刚开始体验时可能遇到的bug现在都已经修复了,感谢大家的包容和耐心。bug可以修,但信任这种东西,消耗起来容易,重建起来很慢。这轮AI军备竞赛的下一个瓶颈,也许不只是算力和数据,还要看谁能在快速迭代的同时,不把自己的用户甩下车。这次Anthropic发布了迁移指南,但用户更想要的其实是一个承诺:升级不能把原有的工作流推倒重来。当AI从玩具变成生产力工具,快速迭代就不再是无条件的优点了。Opus 4.8会怎么来,Anthropic还没说,但用户的耐心已经开始倒计时了。





