国产算力市场迎来超节点外的新变化。

2026年07月24日 19:39
本文共计5072个字,预计阅读时长17分钟。
来源/证券时报网 责编/LaosijiAming 老司机阿明

在2026年世界人工智能大会(WAIC)的算力展区,壮观的成排服务器机柜依然是最显眼的存在。华为、中科曙光、沐曦等厂商密集展示了超节点和万卡、十万卡集群,国产算力的竞争维度已经从单颗芯片扩展到了整机柜、集群乃至整个数据中心。

不过,本届WAIC上,国产算力释放的信号远不止超节点,记者在展会现场观察到,国产算力行业已开始直面更具体的技术挑战和商业问题:不同技术路线能否摆脱对单一架构与先进制程的依赖,集群能否稳定产出低成本Token,海外客户是否愿意为国产方案付费,以及算力能否真正上天。

这些变化指向同一个方向:国产算力正告别以芯片参数和概念验证为主的早期阶段,转向工程交付与场景落地的综合性竞争。

算力架构路径不再唯一

先进制程、高带宽内存(HBM)和CUDA生态是当前高端AI芯片竞争的三道主要门槛。面对外部供应限制,国产算力过去的主要路径是加快通用GPU架构的追赶。本届WAIC上,一个明显变化是,更多厂商开始从底层架构寻找差异化解法。

记者注意到,算力技术路线进一步分化。除GPU外,异构众核、可重构计算、近存计算、光计算等方案集中亮相。它们未必意在取代GPU,而是试图在推理、科学计算、边缘部署等特定场景中,以架构差异换取成本、能效或供应链优势,并加快寻找商业化落点。

东方算芯首次展出的DF1000便是其中之一。按照公司披露,该芯片采用软件定义芯片加三维堆叠近存计算的路线,通过空间并行以及硬件资源时分复用提高利用率,并将计算与存储单元垂直堆叠以缩短数据搬运距离。DF1000采用国内十四纳米成熟工艺,其BF16算力达到五百二十TFLOPS,访存带宽达到六点四TB/s,Scale-up互连带宽为九百GB/s。

东方算芯借助DF1000“14nm≈4nm”这一宣传口号,成功引发了极大关注。根据相关介绍,该芯片运用3D混合键合技术对计算层与存储层进行垂直堆叠集成,从而把互连间距从数十微米压缩至亚微米级别,这得以实现了互连密度以及带宽密度的数量级提升。单卡在BF16精度下的峰值算力达到了520 TFLOPS,原生访存带宽高达6.4 TB/s。借助架构、存储与封装的协同设计,成熟制程在特定AI负载下,也能够获得接近先进制程产品的有效性能。

太初元碁在WAIC首次公开了新一代国产AI芯片Ultra,凭借HCU异构众核架构将CPU与AI算力核通过统一高速总线连接,并支持两类算力单元的灵活重构,其中CPU侧专注于智能体调度与复杂数据预处理而XPA算力阵列则作为专用加速单元承担大模型的高效训推任务。据介绍,Ultra原生覆盖从FP64到FP4的全精度,其中FP64算力达38 TFLOPS,FP4稀疏算力高达4800 TFLOPS。

同时,以Ultra为核心的元碁HyperIntelliX系统,借助同一套硬件同时满足万亿参数大模型训推以及AI4S科学计算场景需求,从而大幅降低行业客户硬件重复投入成本。太初元碁同期发布的AI4S计算平台,针对科学计算高并发、大吞吐量以及长时任务稳定运行等特点进行了专项优化,将算力调度、作业管理、开发环境以及科学计算套件等能力进行整合,面向气象、海洋、材料、生物等领域提供服务。

瞄准Token效率

以往,算力市场习惯以FLOPS每秒浮点运算次数衡量芯片的理论性能如今随着算力厂商竞争重心转向实际算力产出和Token经济Token效率正成为厂商频繁提及的新指标

Traditional FLOPS still serves as an important indicator of the theoretical computing capability of chips, yet this does not mean that customers ultimately obtain effective output. Factors such as chip utilization, memory bandwidth, inter-card interconnection, operator optimization and power costs will all affect how many Tokens can be output per second by a set of computing systems and decide how much each Token costs.

智能体进一步放大了这一变化。过去,一次对话通常由人发起,现在一个智能体在完成任务时可能连续调用模型、搜索网页、操作软件并与其他智能体协同,Token消耗场景迅速转向智能体之间的调用,用户开始更关注首Token时延、Token吞吐量、单位能耗下Token产出等,而不再只看单卡峰值。

摩尔线程将算力基础设施划分为模型训练工厂、词元生产工厂以及智能体生产工厂。摩尔线程披露,夸娥万卡集群的线性扩展效率最高可达95%,有效训练时长占比超过90%。在推理侧,其软件栈已适配SGLang、vLLM以及DeepSeek、MiniMax、GLM、Kimi、Qwen等模型,并尝试将预填充和解码阶段放在不同类型的芯片上运行以降低总体成本。摩尔线程CEO张建中表示,由3张S5000与2张国际主流GPU组成的异构系统整体吞吐量可接近9张同类国际GPU的水平。

值得注意的是,商汤科技宣布联合近20家国产芯片及基础设施厂商建设Token运营中心。未来两年规划建设5个万卡以上国产算力集群。商汤已针对多款国产芯片进行性能调优,并完成对业内主流开源模型的适配,共同优化从模型输入到Token输出的完整链路。

Yangfan, co-founder and president of the General Large Equipment Business Unit at SenseTime, noted that in the domestic heterogeneous hybrid inference cluster, the cost-effectiveness of domestic computing cards for proprietary tasks such as Prefill has already exceeded that of NVIDIA H-series by more than two times. Compared with before tuning, its own performance improved by more than 200 percent, thereby providing profit space for the large-scale commercial implementation of domestic inference clusters. At present, SenseTime can already support a daily call volume of 24 trillion tokens, and according to the existing growth plan, it is expected that by the end of 2026 the call volume will further rise to the level of 100 trillion tokens.

但是,业内人士对相关厂商提出的“Token工厂”和“Token效率”概念仍存在争议,指出“Token效率”作为指标目前仍带有较强的产业概念色彩,不同模型、精度、上下文长度和服务质量下产生的Token,并非可以直接横向比较的标准商品。只有在相同模型和负载条件下,结合准确率、响应速度、能耗与稳定性,单Token成本才具有实际比较意义。

走向交付和订单

算力厂商发力“Token经济”的背后,是国产算力正进入广泛的应用领域。

从现场观察看,国产算力厂商此前展示案例时,常见表述还是“完成某款模型适配”或“点亮服务器”。在今年WAIC上,更多企业开始披露万卡训练、长时间稳定运行、模型精度对齐和实际客户部署情况,这意味着国产算力正从单点适配和工程验证走向规模化生产环境,应用边界与商业化空间随之拓宽。

这一变化已在两大国产GPU龙头的业绩中得以体现。摩尔线程在今年3月签订了6.6亿元的“夸娥”智算集群订单。2026年一季度,公司实现营业收入7.38亿元,同比增长155.35%,归母净利润为2935.92万元。沐曦股份在该季度实现营业收入5.62亿元,同比增长75.37%。公司称收入增长主要来自GPU产品出货量提升。

In the context of the accelerated commercialization of domestic GPUs, overseas interest in alternative solutions to NVIDIA is also rising. During the WAIC, foreign customers found their way to the exhibition booths of domestic GPU manufacturers and engaged in face-to-face discussions on substitution options, with one of the most common opening remarks being, “NVIDIA is too expensive. How about your products?”

有海外客户直接走进国内GPU公司的展台,带着具体的测试需求,询问兼容性和性能等指标。一家海外AI解决方案提供商直言,问题不在供货,而在价格。一家外国公司明确透露,明年将把替代英伟达列为最核心目标,正在寻找更具性价比的替代方案。

These proactive overseas customer inquiries indicate that domestic computing power is gaining visibility among additional overseas customers. However, converting these into concrete orders requires surmounting multiple additional thresholds, including software adaptation, local service provision and continuous iteration. For domestic vendors, whether they can establish a mature software ecosystem and a localization service system will represent the key to opening the overseas market.

同期,商汤科技宣布将在沙特阿拉伯地区部署中国出海的国产算力集群,以此向海外输出AI基础设施的中国方案。

国产算力开始试探“上天”

本届WAIC上,国产算力的边界进一步从地面延伸至太空。记者观察到,多家算力厂商展出了与卫星结合的太空算力相关方案,让被马斯克带火的太空算力故事在本届大会上有了实感。

所谓太空算力,指的是将大量AI算力硬件发射至太空,利用太空光伏提供能源,并且借助极冷的太空环境为GPU降温,从而降低算力成本。马斯克曾设想,太空算力未来可达到兆瓦级别。他甚至畅想在月球建设发射基地,进一步将太空算力规模提升至1拍瓦,即1太瓦的1000倍。在他看来,AI能力只有达到如此规模,才能帮助人类迈向星际文明。

马斯克提出的太空算力构想在国内也开始进入早期工程验证阶段在世界人工智能大会上上海理工大学与云计算厂商优刻得联合发布太空算力样机将光伏供能与储能以及高性能GPU计算和泵驱闭环液冷热管理集成于一体据校方披露该样机已完成实验室测试可支持大模型推理遥感图像处理以及数字孪生仿真等任务

商汤科技与国星宇航宣布达成太空算力战略合作,共建“商汤算力星座”。按照规划,双方将在2026年发射4颗“商汤号”算力卫星,开展早期技术验证和原型迭代;到2030年,逐步建成千颗级组网、总算力超过万PFLOPS的太空算力星座。同期,深空矩阵发布“星环计划”,第一阶段拟部署约210颗卫星,验证空间数据获取、星间高速激光通信和在轨边缘计算等能力。

多位相关人士在现场交流中向记者坦言,相较于成熟的地面数据中心,太空算力仍处于早期验证阶段。在真空环境中,芯片还需要应对辐射温差以及在轨维护等难题,太空算力星座的规模化部署也受到能源供给热管理星间通信以及发射成本的限制。因此,WAIC上亮相的样机与星座规划更多意味着产业开始由概念构想转向工程验证,距离太空数据中心大规模部署仍有很长的路要走。

来源:超节点外 国产算力有这些新变化 | 证券时报网

声明:本文来自证券时报网,版权归作者所有。文章内容仅代表作者独立观点,不代表爱力方立场,转载目的在于传递更多信息。如有侵权,请联系 copyright#agent.ren。
0
TAGS: []

相关图文

热门资讯