英伟达Blackwell旗舰卡皇GB300再破纪录:混合专家模型预训练算力飙至1648 TFLOPs!
得益于软件算法的深层调优,英伟达Blackwell系列的GB300与GB200算力卡在各类AI大模型任务中继续领跑全场。尽管外界原以为英伟达会把全副精力砸向全新的Rubin架构,但早已跑在各大数据中心的Blackwell算力集群却跟曾经的Hopper一样,靠着持续的软件迭代疯狂释放潜能,顶级旗舰GB300更是频频刷爆AI算力的性能纪录。
据英伟达官方最新披露的数据,对Blackwell AI平台的不断打磨,让整机的算力输出与能效比大幅跃升。仅仅用了三个月时间,在同样的GB200 NVL72服务器配置下跑DeepSeek R1大模型,单位功耗下的吞吐量就直接飙升了4倍之多。在此期间,研发团队狂跑了25万余种模拟组合,给Blackwell底层砸进了38项重磅算法优化,硬生生消耗了140万个GPU测试机时。更绝的是,这些成果里有九成以上都能无缝套用到其他大模型上,足见英伟达即便在推进新架构的同时,也绝不放弃对老牌AI算力平台的迭代支持。
而在AI大模型预训练赛道,号称“Blackwell Ultra”的GB300机架更是掌控全场。在动用256张GPU集群承载 DeepSeek-V3 671B 巨量模型时,基于 Megatron Core 引擎做到了单卡1648 TFLOPS的霸榜战绩,相比GB200之前的606 TFLOPS直接暴涨3倍。凭借GB300 NVL72创下的这项预训练算力纪录,想要搞定同等规格的训练任务,硬件规模就能缩减一大半。同时这套GB300 NVL72系统在经过半年来的算法洗礼后,其综合性能表现又硬生生拉高了1.5倍。
与此同时,英伟达还深度联动了PyTorch和JAX等主流开源大模型生态,确保这些算力黑科技能全面落实到具体开发中。比如用PyTorch原生的 TorchTitan 训练栈跑 DeepSeek-V3 时,Blackwell Ultra 算力单元在无需任何额外调整的前提下,直接砍下了6倍的性能飙升。JAX生态的涨幅则更加夸张,单卡吞吐性能飙到1025 TFLOPS、每秒吞吐4082个Token,比今年初的初始基准快上了整整10倍。
不仅如此,英伟达还在各大主流AI预训练框架中,实现了256卡到1024卡规模的顶级线性扩展能力。当集群扩展到1024张显卡时,Megatron Core的并行扩展效率依然高达98.5%,而TorchTitan和JAX也能稳稳维持在97%的超高水平。能撑起如此离谱的跨节点协同能力,关键就在于NVL72整机内部搭载的800Gb/s高性能横向扩展网络互联架构。从大模型预训练到后端推理部署,英伟达正在不断拔高AI基础设施的性能天花板,即便下一代Rubin架构也已蓄势待发,其他竞争对手想要跟上这个迭代节奏依然压力山大。





