留言

AI自创“算力魔法”,Kimi K3飞速演算如闪电

上周,我们的朋友们在人工智能的舞台上又刷了一波存在感!Inferact这支由vLLM团队组成的壮观小队伍,发布了个震撼性的“TPU Megakernels”——听起来就像是某个科幻片的超能武器,但它实际上是一组专为Kimi K3量身定制的超巨算子。想象一下,92层的MoE——也就是“专家层”,都被装进了一个巨型程序里,直接把16颗谷歌TPU v7变成了狂飙赛车!结果?单用户的输出速度达到了709 tokens/s,比起英伟达GB200的452 tokens/s,简直就像是坐上了火箭。

果然,硬件规格并不是唯一的胜负手。虽然TPU v7的显存带宽比GB200略逊一筹,但这回的胜负果然是写法的功劳。嘿,顺便说个小秘密,这套超算子只需不到90秒就能从零编译完成,以前在TPU上搞同样规模的大模型可能要动辄半小时以上,简直让人怀疑以前的编译是让程序员喝了多少咖啡!

而国内同样没有闲着,在AICC2026大会上,浪潮信息放出了一枚重磅炸弹——元脑SD200 Ultra超节点AI服务器,竟然能够用128核的本土AI芯片,单机把K3的Token生成延迟压到惊人的5.85毫秒。这场算力的“超级算子”对决,真是让人看得目不暇接。 开云

那么,大模型输出慢的原因究竟是啥呢?许多人第一反应是算力不足,但其实芯片大半时间在干等数据。推理每生成一个token,模型得把参数从显存里搬一遍。算得再快,数据不来也是白搭。原来推理速度这座“天花板”,大多由显存带宽决定。

更多时候,罪魁祸首还是那些“小算子”。算子就像分别负责不同小工作的勤快小蜜蜂,传统推理框架里生成一个token得先启动一大串这些小蜜蜂,每个都得经历“搬数据—计算—写回去”的轮回。就想象一下,如果你坐的是那种老式绿皮火车,路线超过几百个小站,简直得慢到你百无聊赖。还好,现在有了算子融合这条“高铁”,让我们一站直达目的地,再也不必担心那些烦人的小站了。

about image

Inferact直截了当地干脆,把所有92层都装进一个算子里,通过程序自个判断该用KDA还是MLA(K3的两种注意力机制)。他们的“凭空取物”充分发挥了TPU v7的每个核心自带64MiB的高速内存,让数据流动变得异常流畅。GPU那种要分给一百多个计算单元的小内存,简直像在分蛋糕,想提前囤货?根本没有地方! 开云

至于编译速度之所以快得惊人,Inferact给的解释也很直接:以前的编译器在成百上千个操作里摸索,而现在他们的工程师手动优化让速度暴涨,简直是“人力神功”。不过,听着也得小心,一“手工”可是亚历山大,毕竟四位作者都是顶尖推理工程师,写这样一个超巨算子,门槛大得让人咽口水。

更酷的是,Inferact在博文里放出了一条消息:将来会有更多这样的超级算子由“编程智能体”来写,AI将逐步接过这门“算子写作”的技艺。这可不是在开玩笑呢!比如,DeepSeek的算子工程师刘胜就表达了对自己的告别,预言不远的未来AI写的算子会比他自己写得更快、更新、更稳。想想看,一年前他的AI助手还在捉虫,这一年转眼间就能自己编码调优,真是日新月异。

在这个领域,不光是美国,国内的浪潮信息同样在开展“算子融合”,推进整体超节点系统的优化。两者虽然同在一条路上,但Inferact的做法是将整个解码过程合并成一个算子,而浪潮信息则以相对较小的粒度在KDA、Gat等算子之间优化。可以说,科技的追逐赛已经火热开跑,未来令人期待的飞跃,大家准备好迎接这场“算力狂欢”了吗? 开云

华莱士:从初出茅庐到自信满满的篮球小巨人 [无下一篇]