蚂蚁百灵大模型今天正式推出了Ling-2.6-flash,这是一款总参数量104B、激活参数7.4B的Instruct模型。
蚂蚁百灵今天正式推出了Ling-2.6-flash,这是一款总参数量104B、激活参数7.4B的Instruct模型。它主打“Token效率”,在保持有竞争力的智能水平的同时,速度更快、成本更低,也更适合大规模的真实应用场景。
根据权威三方评测机构Artificial Analysis的数据,Ling-2.6-flash在Token效率上的优势非常突出。它用了15M的输出Token就拿到了26分的智能指数,在保持较强智能水平的同时,把输出消耗控制在了相对更低的水平。
据了解,Ling-2.6-flash沿用了Ling 2.5的混合线性架构设计。这种高度稀疏化的MoE架构在硬件表现上优势很明显。在4卡H20的条件下,推理速度最快能达到340 tokens/s,Prefill吞吐量是Nemotron-3-Super的2.2倍。在输出速度测评中,Ling-2.6-flash以215 tokens/s的稳定输出速度,排在同参数级别模型的第一梯队。
从Token消耗来看,Ling-2.6-flash的智效比显著提升。在Artificial Analysis的完整测评中,Ling-2.6-flash的总消耗是15M tokens,而Nemotron-3-Super等模型要达到110M tokens以上。也就是说,Ling-2.6-flash只用了大约十分之一的Token消耗就完成了同样的评测任务。
Ling-2.6-flash针对Agent场景做了定向增强,在控制Token消耗的前提下,依然保持了很强的任务执行力。模型在BFCL-V4、TAU2-bench、SWE-bench Verified、Claw-Eval、PinchBench等多个Agent相关的基准测试中,都达到了同尺寸模型的最优水平。同时,Ling-2.6-flash在通用知识、数学推理、指令遵循以及长文本解析等方面也保持了优秀的水准。
API定价方面,Ling-2.6-flash输入每百万tokens收费0.1美元,输出0.3美元。目前,Ling-2.6-flash的API已经正式向用户开放,并提供为期一周的限时免费试用。用户可以通过OpenRouter或者百灵大模型的tbox来获取相应的服务。据了解,该模型后续还会通过蚂蚁数科发布商业版本LingDT,服务全球的开发者以及中小企业。





