Mario Kart Wii 静态重编译游戏下月登陆 PC:支持 4K 输出 200 多条赛道
2026-07-19
2026-07-21 0
21世纪经济报道记者 彭新

在2026世界人工智能大会(WAIC)期间,摩尔线程系统披露其模型训练、词元(Token)生产和智能体生产三大“AI工厂”的最新进展,并首次公开多项训练和推理实践数据,进一步强化其大规模AI基础设施布局。
摩尔线程创始人、董事长兼CEO张建中将三类基础设施分别定义为“模型训练工厂”“词元生产工厂”和“智能体生产工厂”,覆盖模型预训练和强化学习、规模化推理,以及数字智能体和具身智能训练。张建中表示,三类“工厂”均建立在摩尔线程自研MUSA架构及“夸娥”万卡智算集群之上。
随着大模型竞争从预训练延伸至强化学习和智能体,算力需求不再只由模型参数决定。一个智能体在完成任务时,可能连续调用模型、搜索信息并操作软件工具,Token消耗场景由人类主动问答转向机器自动调用。摩尔线程判断,GPU竞争的衡量标准正在从单卡算力转向集群能够以多低的成本、持续生产多少高质量Token。
在模型训练侧,摩尔线程正在补齐从底层芯片到训练框架的软件链条。“我们从底层MUSA开始,在MUSA的SDK基础上,把全行业当中所有的各种各样的算子都兼容进来。”张建中称,其MUSA软件栈已经适配PyTorch、Triton和TileLang等算子生态,并支持Megatron-LM、DeepSpeed、FSDP以及强化学习框架VeRL、Slime。
从训练结果来看,摩尔线程称,“夸娥”万卡集群线性扩展效率最高可达95%,有效训练时长占比超过90%。摩尔线程高级副总裁董龙飞告诉记者,在DeepSeek类MoE模型上,其平台与国际旗舰GPU训练结果的前3万步平均相对误差控制在万分之六以内。
在实际训练案例中,摩尔线程称已与一家国家级实验室从零训练MoE-236B模型。由北京大学EvoPhys团队推出的5D世界模型EvoPhys-World,也在MTT S5000集群上完成全栈原生训练,并连续37天位列WorldScore世界生成榜单第一。此外,摩尔线程还与北京智源研究院、极佳视界等机构合作训练具身智能和驾驶世界模型。
摩尔线程此次密集披露训练案例,意在证明国产GPU已从模型适配阶段迈入万卡级大规模训练环节。过去国产GPU更多用于推理,原因在于大规模训练对芯片、互联、通信库及软件框架的协同稳定性要求极高,集群中任何单点故障都可能导致持续数周的训练任务中断,从而大幅推高训练成本。
不过,训练只是算力需求的一部分。董龙飞表示,训练和推理对算力产品要求不同,训练对性能差异的容忍度相对较高,即使性能低10%,也可以通过延长训练时间完成任务;推理则直接关系到单位Token成本,成本高出10%就可能失去竞争力。
为争夺推理市场,摩尔线程的“词元生产工厂”目标是以更低成本和更高吞吐量持续生成Token。目前,其推理软件栈已适配SGLang、vLLM等框架,并支持DeepSeek、MiniMax、GLM、Kimi和Qwen等国产大模型,实现主流大模型的发布即适配。摩尔线程还表示,其与部分模型企业的合作正从发布后适配前移至研发阶段的联合共研,力争在模型发布之日即完成调优。
异构推理是摩尔线程降低Token成本的重要路径。在大模型推理过程中,Prefill(预填充)阶段负责理解输入内容,更依赖计算能力;Decode(解码)阶段逐字生成结果,则更依赖显存容量和带宽。张建中举例,有客户把Prefill放在S5000上计算,把Decode放在已有的国际主流计算卡上,从而降低了成本。
张建中还称,由3张S5000与2张国际主流GPU组成的异构系统,整体吞吐量可接近9张同类国际GPU的水平。
为了进一步扩大单个计算单元规模,摩尔线程推出C256超节点,将256张GPU通过自研MTLink协议互联并整合为统一系统,既可用于构建10万卡集群,也可承载参数量和上下文窗口持续扩大的模型。
然而,超节点在成本、投资与技术层面均面临巨大挑战。董龙飞称,一套完整超节点的投资在1亿元以上,功耗可能达到400千瓦,除GPU外还需集成CPU,散热、可靠性以及各模组之间的解耦仍是必须攻克的工程难题。他表示,从万卡走向10万卡并非简单堆叠服务器,而需要“一层层网络级联”的新架构,即由多个超节点组成Pod,再由多个Pod构成10万卡集群。其间,卡间通信与系统可靠性是核心挑战——万卡若有1%的故障率,到10万卡规模,可靠性将呈指数级恶化。
在“智能体生产工厂”布局上,摩尔线程推出数字智能体“小麦”与具身智能仿真平台MT Lambda,并通过MTT AIBOOK、MTT AICUBE等终端设备探索端云协同。但相较于模型训练与词元生产两大工厂,摩尔线程的“智能体工厂”尚未形成清晰的收入模式。张建中明确表示:“智能体工厂是公司一个全新的研究方向。”
围绕Token经济热潮,产业竞争正从芯片算力供给延伸至集群建设、算力调度与生态运营,各方布局不断。WAIC期间,商汤科技宣布联合近20家国产芯片及基础设施厂商建设Token运营中心,两年内规划5个万卡以上国产算力集群;中科曙光则发布全国产10万卡AI超集群“曙光8000(登峰)”,采用超智融合架构设计,支持从FP64到INT8全精度计算,实现了全类型计算的原生一体化融合。