OpenAI在今天凌晨突然发布了GPT-5.5。这次最核心的变化,不是它回答得更好看了,而是它变得更像一个能自己干活的系统:能够理解复杂的目标,自己拆解步骤、调用工具、核对结果,把一个多环节的任务从头推到尾。OpenAI这次想卖的,不只是更聪明,而是真的能干活。



能力上去了,价格自然也跟着上去了。官方API的定价是:GPT-5.5每百万个输入token收费5美元,输出收费30美元。跟上一代GPT-5.4的2.5美元和15美元比,正好翻了一倍。不过OpenAI也说了,GPT-5.5在很多复杂任务里可以用更少的token把事情办完。

目前GPT-5.5已经开始在ChatGPT和Codex上陆续上线了。在ChatGPT里面,GPT-5.5 Thinking版本面向Plus、Pro、Business和Enterprise用户开放,GPT-5.5 Pro版本则面向Pro、Business和Enterprise用户。API版本官方说很快就会跟上。

先来看看数据。GPT-5.5在一系列硬核基准测试中,把上一代GPT-5.4甩在了身后,也压过了竞争对手一头。

在最能体现智能体规划和工具协调能力的Terminal-Bench 2.0测试里,GPT-5.5拿下了82.7%的准确率,大幅领先Claude Opus 4.7的69.4%和Gemini 3.1 Pro的68.5%。在评估跨44种职业知识工作能力的GDPval测试中,GPT-5.5达到了84.9%的胜率或平局率,Claude Opus 4.7是80.3%,Gemini 3.1 Pro只有67.3%。在衡量模型自主操作真实计算机环境的OSWorld-Verified上,GPT-5.5得分78.7%,跟Claude Opus 4.7的78%差不多持平。

数学能力方面,GPT-5.5在FrontierMath上的表现尤其突出。1到3级题目得分51.7%,Claude Opus 4.7是43.8%,Gemini 3.1 Pro是36.9%。到了最难的4级,GPT-5.5的35.4%远远超过Claude Opus 4.7的22.9%。网络安全方面,CyberGym测试中GPT-5.5得分81.8%,Claude Opus 4.7是73.1%。在客户服务场景的Tau2-bench Telecom测试中,GPT-5.5没做任何提示调整就达到了98.0%的准确率。

OpenAI内部还有一个叫Expert-SWE的基准,用来评估长周期的编码任务,预估人类专家中位完成时间大概是20个小时。GPT-5.5在这里达到了73.1%,上一代GPT-5.4是68.5%。在公开的SWE-bench Pro上,GPT-5.5的58.6%和Claude Opus 4.7的64.3%算是互有胜负。

第三方评测机构Artificial Analysis做了全面的测试。他们的结论是,GPT-5.5让OpenAI重新坐回了AI领域的绝对第一,在他们设定的智能指数里领先了3分,打破了之前跟Anthropic和谷歌三方平局的格局。在五大核心评估中,GPT-5.5在Terminal-Bench Hard、GDPval-AA和APEX-Agents-AA这三项里都拿了第一。

科学研究领域也没落下。在专注遗传学和定量生物学的GeneBench上,GPT-5.5得分大约25%,上一代GPT-5.4大约是19%。在生物信息学基准BixBench上,GPT-5.5以80.5%领先于GPT-5.4的74.0%。

这些数字拼在一起,勾勒出一个大致的轮廓:GPT-5.5在需要规划和持续执行的智能体任务上优势很明显,在数学和网络安全这类需要深度推理的领域也拉开了距离,但在一些没有工具的纯学术推理上还是有来有回。OpenAI的研究副总裁阿米莉亚·格莱斯说,不管是从基准测试来看,还是从可信合作伙伴的反馈以及他们自己的经验来看,这绝对是他们目前为止最强的编码模型。

但有一组数据不得不提前摆出来。在Artificial Analysis的私有基准测试AA-Omniscience中,GPT-5.5展现了一个矛盾到让人不太安心的特征。GPT-5.5的准确率是所有模型里最高的,达到了57%,说明它在回忆事实方面确实比所有竞品都强。然而它的幻觉率高达86%。作为对比,Claude Opus 4.7的幻觉率是36%,Gemini 3.1 Pro是50%。换句话说,GPT-5.5知道的东西确实更多,但当它不确定答案的时候,它选择闭嘴的概率远低于对手,更倾向于硬着头皮给出一个回答,哪怕这个回答可能是错的。

这组数据和它“明白该做什么”的核心叙事之间,形成了一种直接的张力。一个幻觉率86%的模型,意味着它遇到不确定的情况,十次里差不多有九次会选择硬答,而不是承认自己不知道。这种自信地做错事的倾向,恰恰是一个被寄予厚望要去自主规划和执行任务的模型,最需要警惕的地方。也就是说,GPT-5.5确实比以前更能干了,但它在干活的过程中不知道自己不知道什么的概率,也比几个主要竞争对手高出了一大截。

这不是一个能轻描淡写带过去的小毛病。如果这个模型真的被委以独立操作电脑、分析数据、生成报告的职责,那用它的人最好时刻记着,它干活的主动性和它犯错的主动性,可能来自同一种底层机制。Artificial Analysis的测试表明,从GPT-5.4到GPT-5.5,在这项基准上的14分涨幅,主要是因为知识增长了,幻觉方面只有很有限的改善。也就是说在目前的架构下,更强的能力和更高的幻觉率,很可能是同一枚硬币的两面。

比分数更值得留意的,是GPT-5.5达成这些分数的方式。它用的输出token数量大幅减少了。简单说,它找到答案的路径变短了。

在Terminal-Bench 2.0测试里,GPT-5.5用大约3000到4000个输出token就达到了约82%的分数,而GPT-5.4用差不多的token数时只有约75%。在Expert-SWE测试里差距更夸张,GPT-5.5用了大约30000到35000个输出token就达到了约73%的分数,GPT-5.4却花了超过60000个token才拿到68.5%。在Tau2-bench Telecom里,GPT-5.5用大约2000到4000个token就达到了98%的准确率,GPT-5.4用了超过10000个token才达到约92%。

这种token效率直接影响了成本。Artificial Analysis的计算显示,虽然GPT-5.5每个token的价格比GPT-5.4翻了一倍,涨到了每100万输入5美元和输出30美元,但因为token使用量减少了大约40%,这个涨幅几乎被完全抵消了。运行他们的智能指数,净成本只增加了大约20%。在他们的编码智能指数图表里,GPT-5.5稳稳地坐在右上方,用相对较少的输出token实现了最高的智能分数,在成本和性能之间找到了目前最好的平衡点。

需要说明的是,这个40%的节省幅度是在编码和推理类的基准任务上测出来的。如果使用场景不一样,比如长篇写作或者开放式对话,token消耗的减少幅度未必相同,实际成本增幅也会不一样。不过在被引用的这几项具体测试里,从Terminal-Bench到Expert-SWE再到Tau2-bench,token数量的下降是肉眼可见的。

他们还发现,GPT-5.5的不同推理努力程度提供了很灵活的选择。中等努力程度的GPT-5.5,在智能指数上的得分跟Claude Opus 4.7的最高档位差不多,但成本只有它的四分之一,大概1200美元对4800美元。低努力程度的话,花大约500美元就能达到类似的效果。这给用户提供了一个可以根据任务需求来调节智能和成本的阶梯。

而这一切并没有以牺牲速度为代价。按照OpenAI的说法,GPT-5.5在实际服务中实现了和GPT-5.4差不多的每token延迟。这背后是软硬件协同设计的成果。GPT-5.5是和英伟达的GB200、GB300 NVL72系统一起设计、训练并部署的。AI自己也帮了忙,Codex分析了连续几周的生产流量模式后,写了自定义的启发式算法来优化GPU之间的负载均衡,最终把token生成速度提升了超过20%。

英伟达的企业AI副总裁贾斯汀·博伊塔诺评价说,GPT-5.5提供了执行繁重工作所需的持续性能。基于英伟达GB200 NVL72系统构建和服务的这个模型,让团队能够从自然语言提示出发,交付端到端的功能,把调试时间从几天缩短到几个小时,把持续数周的实验变成在复杂代码库中一夜之间的进展。他认为这不仅仅是更快的编码,而是一种全新的工作方式。

数据和效率说完了,再来看看实际体验上到底有什么不同。

GPT-5.5跟之前模型最核心的区别,在于它不再只是等着你一步步告诉它怎么做。用OpenAI总裁格雷格·布罗克曼的话说,这个模型真正特别的地方,是它能在更少的指导下做更多的事,可以审视一个不明确的问题,然后自己弄清楚下一步该做什么。

这跟早期测试者的感受高度一致。Every公司的创始人兼CEO丹·希珀做了一个“倒回时间”的测试。他花了几天时间调试一个发布后出现的问题,然后让他最好的工程师之一重写了部分系统。为了测试GPT-5.5,他把已经损坏的系统状态交给模型,看它能不能产出工程师最终决定的那种重写方案。结果GPT-5.4做不到,但GPT-5.5做到了。他的评价是,这是他遇到的第一个具有严肃概念清晰度的编码模型。

MagicPath的CEO彼得罗·斯基拉诺遇到了更复杂的场景。他让GPT-5.5把一个包含几百个前端和重构更改的分支,合并到另一个也发生了巨大变化的主分支里。模型在大约20分钟内一次性解决了所有冲突,最终完成了一个包含12个差异的堆栈,几乎完整。他说自己的感觉是,真的在跟一个更高的智能一起工作,甚至有一种尊重感。

其他提前拿到测试权限的高级工程师也报告了类似的体验。他们说GPT-5.5在推理和自主性方面,明显比GPT-5.4和Claude Opus 4.7强,能提前发现问题,在没有明确提示的情况下就预判测试和审查需求。有人让模型重新架构一个协作式编辑器里的评论系统,离开一段时间回来发现它已经搞定了一个接近完整的堆栈。还有人说几乎不需要对实现做修正,对GPT-5.5的计划比GPT-5.4更有信心。

Cursor的联合创始人兼CEO迈克尔·特鲁尔从产品角度指出,GPT-5.5明显比GPT-5.4更聪明,也更持久,能持续工作更长时间而不提前停下,这对于用户交给Cursor的那些复杂或长期运行的任务来说至关重要。还有一位英伟达的工程师在提前失去访问权限后说,那感觉像被截肢了一样。

这些反馈共同指向一个变化:GPT-5.5不再是等待指令的被动工具,而是开始展现出某种职业判断力。它能理解系统的全貌,弄清楚某件事为什么会失败,修复应该落在哪里,以及代码库里还有哪些部分会受到影响。公司内部的测试也印证了这一点,OpenAI超过85%的员工每周都在用Codex。

不过也不是所有测试者都给出了毫无保留的赞誉。有人在社交平台上说,GPT-5.5在推理效率和知识方面确实有明显提升,但对他关心的东西来说,他得等下一个版本。他直言不认为GPT-5.5比之前进步了多少,只是渐进式的改进而已。另一位测试者则注意到了速度上的变化:GPT-5.5重度思考模式下两分钟内给出的答案,比GPT-5.4十分钟内给出的更好,但他对智能水平的评价保持了克制。

让GPT-5.5擅长编程的那些能力,放到日常的知识工作中同样管用。它能更自然地完成从查找信息、分析重点、操作软件到生成文档的整个闭环。

Box的联合创始人兼CEO阿隆·列维分享了他们的内部测试结果。在金融服务、医疗保健、公共部门、媒体娱乐等多个行业的真实任务上,GPT-5.5相比GPT-5.4都有显著提升。金融服务从64%提高到83%,医疗保健从61%提高到78%,公共部门从59%提高到72%,媒体与娱乐从57%提高到70%。他认为GPT-5.5将给企业知识工作智能体带来巨大的飞跃。

在ChatGPT里,GPT-5.5的思考模式可以为更难的问题提供更快的帮助,擅长编码、研究、信息综合与分析,以及文档密集型任务。GPT-5.5 Pro版本更进一步,早期测试者反映,它的回答比GPT-5.4 Pro更全面、结构更清晰,也更准确、更有用,在商业、法律、教育和数据科学领域表现得尤其突出。

OpenAI内部的日常使用案例更能说明问题。财务团队用Codex审查了24771份K-1税表,总共71637页。工作流程排除了个人信息后,帮助团队比前一年提前了两周完成任务。通信团队用它分析了六个月的演讲请求数据,构建了评分和风险框架,还验证了一个自动化Slack智能体来处理低风险请求。有一名市场部的员工自动化了每周业务报告的生成,每周省下五到十个小时。

科学研究领域是GPT-5.5的另一个亮点。它的价值不在于给出一个一次性答案,而在于帮研究人员走完从问题到实验再到产出的完整过程。

沃顿商学院的教授伊森·莫利克提前拿到了模型,他用一个拖延了十年的真实研究项目来做终极测试。他把几百个尘封已久的关于众筹的匿名化数据文件丢给Codex里的GPT-5.5,文件混合了STATA、CSV、XLS和Word格式,然后只给了四个提示,要求它整理数据、提出新假设、用复杂方法检验、最后写成学术论文。结果模型产出的论文里包含了真实的文献综述和复杂的统计分析。他的评价是,如果这是二年级博士项目的成果,他会非常满意。

杰克逊基因组医学实验室的免疫学教授德里亚·乌鲁特马兹用GPT-5.5 Pro分析了一个包含62个样本和近28000个基因的表达数据集。模型在几分钟内就生成了详细的研究报告,并提出了关键问题和见解。他说这项工作本来需要他的团队花上几个月。他还说,用了GPT-5.5 Pro之后,他感觉AI又到了另一个拐点,就像以前某些关键版本发布时让他感受到的那种跨越门槛的感觉。

在数学领域,一个更硬的成果来自组合学。一个内部版本的GPT-5.5在配备了定制工具之后,帮忙发现了关于拉姆齐数的新证明。拉姆齐数是组合学里的核心对象,这个领域的结果本来就很少见,技术难度也很高。GPT-5.5找到了一个关于非对角拉姆齐数长期存在的渐近事实的论证,随后在Lean中得到了验证。这意味着它不只是在辅助研究,而是直接在核心研究问题上贡献了令人惊讶并且有用的数学论证。

波兰亚当·密茨凯维奇大学的数学助理教授巴托斯·纳斯克雷基在Codex里用GPT-5.5,只靠一个提示就在11分钟内构建了一个代数几何的应用,完成了以前需要专用工具才能实现的定制数学可视化。Axiom Bio的联合创始人兼CEO布兰登·怀特则从药物发现的角度给出了判断。他让GPT-5.5推理庞大的生物化学数据集,用来预测人类的药物结果,结果看到它在最难的评估里带来了显著的准确性提升。他的判断是,如果OpenAI继续保持这个势头,药物发现的基础将在年底前发生改变。

GPT-5.5的网络安全能力比GPT-5.4又进了一步。OpenAI把它在生物和网络安全方面的能力评估为高风险。在夺旗挑战任务中,GPT-5.5用大约20000到40000个输出token就达到了约88%的得分,而GPT-5.4用了超过100000个token才拿到约84%。这种效率的提升意味着,它发现和利用漏洞的能力变得更强了。

OpenAI采取了一种分层应对的策略。一方面,部署更严格的网络风险分类器来拦截普通用户的敏感请求。他们也承认,一些用户刚开始可能会觉得这些限制有点烦人。另一方面,推出了网络可信访问计划,让经过验证的安全防御者可以申请使用不受限制的模型版本,用来保护关键基础设施。OpenAI表示,他们正在跟政府合作伙伴一起探索,看高级AI如何帮助保卫纳税人的数据、电网和供水系统。

GPT-5.5在发布前经过了完整的安全和治理流程,包括准备评估、特定领域测试,还有跟内部和外部红队、近200个可信早期合作伙伴的合作。奥特曼强调说,他们相信迭代部署是安全策略里很重要的一部分,通过逐步向世界发布模型,大家最有能力在AI韧性这种团队运动中一起应对挑战。

有外媒报道指出,在“人类最后的考试”这类无工具的纯推理基准上,GPT-5.5 Pro的43.1%仍然落后于Anthropic未公开的Claude Mythos Preview的56.8%。这说明在不同的能力维度上,各家模型的优势还在分化。

安全能力的提升也意味着更高的训练和部署成本,这直接反映在了GPT-5.5的定价上。GPT-5.5的API输入价格是每100万token 5美元,输出30美元;GPT-5.5 Pro则是输入30美元,输出180美元。目前GPT-5.5已经向ChatGPT的Plus、Pro、Business和Enterprise用户开放,GPT-5.5 Pro从Pro层级开始。在Codex里,GPT-5.5对从Plus到Go计划的用户都可以使用,上下文窗口是40万token,还提供了一个速度快1.5倍但成本高2.5倍的快速模式。

AI产品专家阿卡什·古普塔分析了这个定价的轨迹。从去年8月GPT-5的0.63美元,到今年3月GPT-5.4的2.50美元,再到七周后GPT-5.5的5美元,八个月里输入定价涨了八倍。而英伟达表示,他们的最新芯片把推理成本降低了高达每token 35倍。古普塔认为,OpenAI的成本基础在急剧下降,但价格却在往上走,这里发生的利润率扩张,在企业软件史上是前所未有的。

布罗克曼之前说过,他们正在构建一个整合了ChatGPT、Codex和浏览器的超级应用。古普塔的判断是,每个在GPT-5.5上构建智能体的开发者,其实都在为OpenAI自己的竞争产品提供资金。他认为OpenAI找到的这种商业模式,很像当年让微软市值达到3万亿美元的那个模式。

莫利克教授还设计了一个横向对比测试。他让从一年前发布的o3到最新的GPT-5.5 Pro等多个模型,去构建同一个程序化生成的3D模拟,展示一个港口城镇从公元前3000年到公元3000年的演变。结果只有GPT-5.5 Pro真正模拟出了一个不断演变的小镇,而不仅仅是生成新建筑去替换旧的。而且它只用了20分钟,GPT-5.4 Pro用了33分钟。

但他也发现了问题。当要求模型创建一个全新的角色扮演游戏规则并配上图和排版时,产出在技术上确实很精巧,101页的PDF排版也很专业,规则看起来也合理。然而仔细读内容就会发现,AI在长篇虚构创作上的老毛病还在。它喜欢用神秘的元素、过于复杂但又没能完全兑现的想法、奇怪的比喻、过多的华丽句子,还有所有角色都相似的语气。他的结论是,即便在所有惊人的技术进步当中,那种参差不齐的前沿依然存在,只是它比以前远得多了。

OpenAI的首席科学家雅库布·帕乔基在发布之际透露,他们实际上还有空间去训练比这聪明得多的模型。换句话说,GPT-5.5不是终点。

就在今天,这个模型已经上线了。对于那些需要处理复杂编码任务、繁琐知识工作或者推进科学研究的用户来说,GPT-5.5提供的不仅仅是一个更快的回答工具,而是一个能理解意图、接管流程、持续推动任务往前走的东西。至于开发者,还得再等一等API的正式开放。在人类把越来越复杂的工作交给AI的这条路上,GPT-5.5是一个值得关注的路标。