摩尔线程扩充万卡集群,算力竞争转向Token工厂
在2026世界人工智能大会(WAIC)期间,摩尔线程系统对其模型训练、词元(Token)生产以及智能体生产三大“AI工厂”的最新进展进行了披露,并首次公开了多项训练和推理实践数据,从而进一步强化了其大规模AI基础设施布局。
摩尔线程创始人、董事长兼CEO张建中对三类基础设施进行了分别定义,将其称为“模型训练工厂”“词元生产工厂”以及“智能体生产工厂”,这些工厂所覆盖的范围包括模型预训练和强化学习、规模化推理,以及数字智能体和具身智能训练。张建中表示,三类“工厂”均建立在摩尔线程自研MUSA架构及“夸娥”万卡智算集群基础之上。
。
随着大模型竞争从预训练延伸至强化学习以及智能体,算力需求不再仅仅由模型参数所决定。一个智能体在完成任务时,会连续调用模型、搜索信息并操作软件工具,从而令Token消耗场景由人类主动问答转向机器自动调用。摩尔线程作出判断,GPU竞争的衡量标准正在从单卡算力转向集群能够以多低的成本持续生产多少高质量Token。
在模型训练侧,摩尔线程正在对从底层芯片到训练框架的软件链条进行补齐。张建中称,其从底层MUSA开始,在MUSA的SDK基础上,把全行业当中所有的各种各样的算子都兼容进来。其MUSA软件栈已经适配PyTorch、Triton以及TileLang等算子生态,并支持Megatron-LM、DeepSpeed、FSDP以及强化学习框架VeRL、Slime。
依据所得训练结果方面来看,摩尔线程表示,“夸娥”万卡集群所实现线性扩展的效率最高能够达到95%,而有效训练时长在整体中所占比例则超过了90%。摩尔线程高级副总裁董龙飞告诉记者,在DeepSeek类MoE模型训练过程中,其平台与国际旗舰GPU所得训练结果的前3万步平均相对误差被控制在万分之六以内。
在实际训练案例当中,摩尔线程表示已与一家国家级实验室从零对MoE-236B模型开展了训练工作。由北京大学EvoPhys团队推出的5D世界模型EvoPhys-World,也在MTT S5000集群上完成了全栈原生训练,并且连续37天位列WorldScore世界生成榜单第一。此外,摩尔线程还与北京智源研究院以及极佳视界等机构合作,对具身智能和驾驶世界模型进行了训练。
摩尔线程此次密集披露训练案例,目的是证明国产GPU已从模型适配阶段迈入万卡级大规模训练环节。过去国产GPU更多用于推理,原因在于大规模训练对芯片、互联、通信库及软件框架的协同稳定性要求极高,集群中任何单点故障都可能导致持续数周的训练任务中断,从而大幅推高训练成本。
。
不过,训练仅仅构成了算力需求当中的一部分内容。董龙飞指出,训练以及推理对于算力产品所提出的要求存在显著差异,其中训练对于性能差异的容忍程度相对较高,即使性能降低了10%,也能够通过延长训练时间的方式来完成相应任务;而推理则会直接关联到单位Token的成本,如果成本高出了10%,那么就可能会丧失相应竞争力。
为了争夺推理市场,摩尔线程的“词元生产工厂”所确立目标是借助更低成本以及更高吞吐量来持续生成Token。目前,其推理软件栈已适配SGLang、vLLM等框架,并支持DeepSeek、MiniMax、GLM、Kimi以及Qwen等国产大模型,得以实现主流大模型的发布即适配。摩尔线程还表示,其与部分模型企业的合作正从发布后适配前移至研发阶段的联合共研,力争在模型发布之日即完成调优。
。
异构推理构成了摩尔线程降低Token成本的重要路径。在大模型推理过程当中,Prefill(预填充)阶段所负责的是理解输入内容,因此会更加依赖计算能力;Decode(解码)阶段所负责的是逐字生成结果,则会更加依赖显存容量以及带宽。张建中通过举例指出,有客户把Prefill放在S5000上计算,把Decode放在已有的国际主流计算卡上,从而降低了成本。
从芯片算力到集群生态
张建中还称,由3张S5000以及2张国际主流GPU所组成的异构系统,其整体吞吐量可以接近9张同类国际GPU的水平。
。
为了进一步扩大单个计算单元规模,摩尔线程推出了C256超节点,将256张GPU借助自研MTLink协议互联并整合为统一系统,既可用于构建10万卡集群,也可承载参数量以及上下文窗口持续扩大的模型。
。
然而,超节点在成本方面、投资规模与技术实现层面均面临着巨大挑战。董龙飞指出,一套完整超节点的投资额度会在1亿元以上,其功耗可能达到400千瓦,除GPU之外还需集成CPU,因此散热处理、可靠性保障以及各模组之间的解耦工作仍是必须攻克的工程难题。他表示,从万卡走向10万卡并非简单堆叠服务器,而是需要运用“一层层网络级联”的新架构,即由多个超节点组成Pod,再由多个Pod构成10万卡集群。其中,卡间通信与系统可靠性是核心挑战——万卡若有1%的故障率,到10万卡规模,可靠性将呈指数级恶化。
在“智能体生产工厂”布局方面,摩尔线程推出了数字智能体“小麦”以及具身智能仿真平台MT Lambda,并借助MTT AIBOOK、MTT AICUBE等终端设备来探索端云协同。但相较于模型训练以及词元生产两大工厂,摩尔线程的“智能体工厂”目前尚未形成清晰的收入模式。张建中明确表示:“智能体工厂是公司一个全新的研究方向。”
在Token经济热潮的推动下,产业竞争正从芯片算力供给逐步延伸至集群建设、算力调度以及生态运营等环节,各方都在持续推进相关布局。WAIC期间,商汤科技宣布联合近20家国产芯片及基础设施厂商共同建设Token运营中心,并规划在两年内建成5个万卡以上国产算力集群;中科曙光则发布了全国产10万卡AI超集群“曙光8000(登峰)”,其选用了超智融合架构设计,能够支持从FP64到INT8的全精度计算,从而成功实现了全类型计算的原生一体化融合。
来源:摩尔线程加码万卡集群 算力竞争转向Token工厂 | 证券时报网