彩云小梦如何控制 AI续写的情感细腻度与悲喜反差?
2026-07-31
2026-08-05 0
7月27日晚,阿里云灵骏真武M890超节点实例已成功适配2.8万亿参数大模型Kimi K3,基于芯片、推理平台和模型的联合优化,有效提升模型推理效率。实测结果显示,该超节点运行Kimi K3的首Token时延降低约35%,长上下文场景下用户体验更流畅。

Kimi K3是月之暗面(Moonshot AI)最新的旗舰模型,参数规模达到2.8万亿,采用混合专家(MoE)架构,其完整模型权重于今日正式开放下载。作为目前业界参数规模最大的模型之一,Kimi K3的高效运行不仅需要大规模算力和显存支撑,还需要高速互联网络让几十张GPU紧密协作,仅靠传统AI集群无法满足高吞吐、低延迟、低成本的推理需求。根据月之暗面官方博客,推荐将Kimi K3部署在“64 卡以上加&速器组成的超节点”上。
灵骏真武超节点实例基于平头哥训推一体AI芯片真武M890打造,通过ICN Switch 1.0互联芯片,可让64张真武M890实现800 GB/s的All-to-All高速互联,显存规模也达到9TB,可将万亿级MoE模型的EP专家并行通信流量,跑在一个高带宽通信域内,有效保证Token生成的效率。
为了让Kimi K3在真武M890超节点实例上实现Day0高效运行,阿里云、平头哥与Kimi 团队从算子、软件栈等层面进行了深度联合适配。依托真武AI芯片的T-Head SAIL软件栈,Kimi自研的Mooncake推理框架实现了快速部署及“开箱即跑”。例如在算子层面,真武M890对Triton的良好支持让大量基于Triton编写的自定义算子无需重写即可直接运行,大幅降低了适配工作量。
在此基础上,三方还针对K3的超大规模MoE架构做了三方面重点优化:
EP 专家并行通信优化
借助ICN64高带宽通信域对MoE最核心的All-to-All专家路由通信进行深度调优,将2.8 万亿参数的专家并行流量完整承载在单一超节点内部,避免跨节点通信成为瓶颈。
MXFP4 混合精度推理
结合真武M890原生支持的MXFP4低精度算力,在保证模型效果无损的前提下,大幅提升计算密度与显存利用效率。
KDA 混合架构算子深度优化
Kimi K3采用KDA(Kimi Delta Attention)线性注意力与全注意力相结合的混合架构,联合团队在真武M890上深度调优了KDA核心算子。充分对齐芯片的并行计算架构与访存特性,并通过算子融合减少Kernel启动与中间访存开销,使注意力计算的算力与带宽利用效率大幅提升。
经过联合优化,Kimi K3在灵骏真武M890超节点实例上不仅实现了Day0平稳跑通,关键推理指标也获得可观提升(以下为阶段性优化实测经验值,供参考):
相比迁移初期基线,首Token时延(TTFT)降低约 35%,长上下文场景下体感更流畅;单卡解码吞吐(Decode Tokens/s)提升约 1.8倍;
借助MXFP4混合量化,提升整体推理效率;
得益于KDA线性注意力混合架构与算子优化,长序列推理算力开销随长度近线性增长,稳定支持最长 1M上下文,从容应对长文档理解、复杂推理等场景。
此次Day0适配背后,是阿里云、平头哥、Kimi团队从芯片、推理框架到云平台的全栈协同。这不仅为Kimi K3 这类万亿参数大模型提供了开源开放的软件栈、国内可获取的高算力选择。未来,三方将继续在模型适配、性能调优与工程化部署上深化合作,持续提升Kimi 系列模型在真武超节点上的推理性能与性价比。