AI现在能自己审查代码了。Opus 4.7出手帮忙解决那种乱七八糟的“屎山”代码。
别的AI厂商发新模型的时候,一上来总会跟你说“我们这次的产品有多厉害、多强大”。但Anthropic就不一样,他们说的是“我们有更强的,但现在还不能给你”。结果就在2026年4月17日,Anthropic还是发布了Claude Opus 4.7。这次发布没啥太大悬念,官方博客也就是照常列了跑分、能力提升和应用场景。不过你要是仔细把整篇公告读完,就会发现有些地方不太对劲。
Opus 4.7是接着Anthropic的Project Glasswing和Mythos Preview之后来的。而就在上周,他们刚宣布Mythos Preview因为网络安全能力太强,暂时限制发布。所以Opus 4.7被明确说成是“第一款用来测试新网络安全护栏的公开模型”。官方甚至还说,他们在训练的时候故意削弱了这个模型的网络安全能力。
那Opus 4.7到底怎么样呢?
先说常规部分。Opus 4.7在好几个基准测试上都超过了Opus 4.6,尤其是在高级软件工程这块。官方给的图里,Opus 4.7在SWE-Bench Verified上拿了87.6%,Opus 4.6是80.8%。在更难一点的SWE-Bench Pro上,Opus 4.7是64.3%,Opus 4.6是53.4%。Terminal-Bench 2.0上,Opus 4.7是69.4%,Opus 4.6是65.4%。Finance agent v11上,Opus 4.7是64.4%,Opus 4.6是60.1%。
用大白话解释一下这些数字就是:你现在可以把更复杂的编程活交给Opus 4.7,它会更仔细地处理那些跑很久的任务,更严格地按你的要求来,还会在交差之前想办法自己先验证一下。
从早期测试者的反馈来看,有几个点值得说一说。
第一个是指令遵循能力提升了不少。Opus 4.7会完全按字面意思来理解指令,不像以前那些模型,经常会松散理解或者跳过某些部分。这听起来是好事,但实际上也可能带来麻烦。它变得更“听话”了,反而会让以前的一些提示词失效。以前的Claude比较会“猜意思”,你写个模糊的指令,它会自动补全你真正想说的,或者忽略掉一些不太重要、互相矛盾、写得不清楚的要求。很多用户的提示词,其实都是在旧模型那种习惯上调出来的。但Opus 4.7更倾向于严格按字面执行,这样一来,旧提示词里那些以前会被自动忽略的小细节,现在可能会被认真执行。而以前模型会灵活处理的模糊表达,现在反而会按最直接的方式去理解。结果就是模型明明更强了,但输出反而跟用户预期的不太一样。
第二个是多模态支持有改进。Opus 4.7可以接收长边最高2576像素的图片,大概3.75兆像素,是之前Claude模型的三倍多。这不是普通的“识图能力”升级,而是为了让AI能看懂软件界面,服务于Anthropic的Computer Use功能。Opus 4.7的视觉升级,不是为了让你问“这张图里有什么”,而是为了让AI智能体能看懂软件界面。如果它看不清密密麻麻的表格、终端输出、设计稿细节、代码截图,那它操作能力再强也没用,因为它只知道怎么干活,却不知道去哪干。Anthropic把图像分辨率往上提,说白了就是在给Claude装一双更清楚的眼睛。以后AI办公、AI测试、AI安全、AI前端开发,很多任务都不是纯文本能搞定的,而是要看屏幕的。
第三个是实际工作表现。内部测试显示,Opus 4.7在金融分析任务上比Opus 4.6更有效,能做出来更严谨的分析和模型、更专业的演示文稿,以及更紧密的跨任务整合。它在GPQAval-AA这个第三方评估里也是最高分,这个评估覆盖了金融、法律等领域。
第四个是记忆能力。Opus 4.7更会用基于文件系统的记忆。它能在长时间、多会话的工作里记住重要的笔记,后续任务需要提前告诉它的信息就更少了。这个点在官方公告里不显眼,但我感觉可能是长期用下来最关键的一个更新。一个能跨会话记住项目限制、用户偏好、架构设计思路和上次失败原因的智能体,才有可能从“聪明临时工”变成“稳定的同事”。
安全性和对齐方面,Opus 4.7和Opus 4.6整体表现差不多。它在诚实度和抵抗恶意提示注入攻击的能力上有所提升,在给出有害建议的能力上有所下降,比如教人怎么制作管制刀具这类问题。官方的对齐评估结论是,这个模型“基本对齐且值得信赖,但行为上还不完全理想”。
价格方面,Opus 4.7和Opus 4.6保持一致。输入每百万token五美元,输出每百万token二十五美元。但迁移指南里提到了两个成本变化。新的tokenizer可能让同样的输入变成1.0到1.35倍的token。在强思考模式下,尤其是智能体的多轮对话,模型会思考更多,输出的token也会更多。所以这就是Anthropic耍小心思的地方了,名义上价格确实没变,但跑多了就会变贵。以前模型计费主要看输入输出长度,现在还要看思考的等级、任务预算、智能体跑了几轮、工具失败后有没有继续推理。Anthropic新加的x-high effort和task budgets,说明高端模型的使用方式正在走当年云计算那套逻辑。你买的不是一次回答,而是在为一个会思考、会试错、会验证的任务过程付费。
再说回来,Opus 4.7真正的卖点之一,恰恰是它没有把全部能力放出来。这听起来有点反直觉,但这可能是下一代模型公司常见的情况。模型越接近真实的生产环境,越不能只追求更强。它得知道哪些事能做、哪些事不能做、哪些用户能开放更多权限、哪些请求必须拦住。Anthropic在发布Opus 4.7的同时,推出了Cyber Verification Program。这个项目本质上是在给能力分级。普通用户拿到的是有护栏的Opus,经过验证的安全专家才能申请更宽松的网络安全用途。模型会自动检测和阻止那些表明是禁止或者高风险的网络安全用途的请求。Anthropic说,他们会从Opus 4.7的真实部署中学习,为以后Mythos级别模型的广泛发布做准备。
不得不说还是Anthropic会玩,他们认为Opus目前的能力是过剩的,所以就把安全这件事变成了产品能力。过去几年,AI公司的竞争逻辑就是“我比你强”。跑分更高、参数更多、能做的事更复杂。但当模型能力达到某个临界点之后,这个逻辑就开始失效了。一个在网络安全测试里表现太好的模型,可能意味着它也能被人恶意使用。一个完全不设限的智能体,就有可能在用户不知情的情况下做出危险决策。Anthropic选的路是,先把最强的模型锁起来,用一个稍弱但足够好的模型来测试安全机制。这不是技术上做不到,而是主动选择不做。这种“克制”本身就成了产品差异化的一部分。
这个策略能不能成,得看市场认不认可“谨慎”这个概念。如果用户只在乎“能不能做到”,那Anthropic的做法就显得保守。但如果企业客户开始重视“会不会出事”,那这种分级发布、主动削弱某些能力的做法,反而可能变成竞争优势。
在发布Opus 4.7的同时,Anthropic还更新了Claude Code,加了auto mode和/ultrareview功能。auto mode不是模型自动选型,而是权限选项。它允许Claude替用户做一些权限决定,让长任务少被打断,但风险比完全跳过权限确认要低。这个设计针对的是智能体产品的核心矛盾:问得太多,智能体像实习生;问得太少,风险又太大。智能体时代最难设计的按钮,不是“开始”,而是“允许”。以前AI只是回答问题,权限很少。现在它要改代码、读文件、跑命令、开网页、提交PR,每一步都有风险。如果每个操作都要用户确认,智能体的自主性就没了意义。但如果完全放手,用户又会担心AI做出没法挽回的错误决定。auto mode的本质,就是在“别烦我”和“别乱来”之间找个平衡。它会根据操作的风险级别,决定是自动执行、提示用户、还是要求明确授权。这也是智能体从“能干什么”到“能不能用”之间的巨大飞跃。
/ultrareview是一个专门的代码审查会话,读取改动并指出bug和设计问题。这个功能可比写代码有意思多了,因为它说明AI编程正式进入了第二阶段,让AI自己审查AI自己生成的代码。AI写代码已经不稀奇了,真正稀缺的是AI能不能审自己的代码。/ultrareview就像是Anthropic给Claude Code补上的第二双眼睛。一个智能体负责写,另一个更谨慎的会话负责审。不用看数据我都能猜到,这两个功能一定会被频繁使用。因为说白了,这两个功能过去就是所有用Claude Code的程序员自己干的活。生成代码只是开发流程的一部分,审查、测试、重构、写文档同样重要。如果AI只能做第一步,它就永远只是辅助工具。如果它能参与整个流程,它才可能真正改变软件开发的方式。
这次发布还有一个细节值得注意。官方在迁移指南里专门提醒大家,Opus 4.7的token使用量可能会增加,但在实际编程评估里,整体效率反而提升了。这说明他们在优化的不是单次调用的成本,而是完成整个任务的总成本。一个智能体如果第一次就把事情做对,就算单次调用贵一点,总成本也比反复试错要低。这是一种更成熟的产品思路。早期AI产品追求的是“便宜”和“快”,现在开始追求“靠谱”。
Opus 4.7不是最强的模型,Anthropic也没有把它包装成最强的模型。它是在能力、安全、成本之间的一个平衡点。但到底是不是真的平衡,我也不知道,这个得等市场来验证。至少在发布策略上,Anthropic给出了一种新思路,因为有时候“不做什么”比“能做什么”更重要。





