华体会官方注册

设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

超智融合新范式:清程极智基于“灵晟”超算实现纯CPU MoE模型分布式推理

2026/7/31 22:01:29 来源:之家网站 作者:- 责编:-

在高性能计算(HPC)与人工智能深度融合的浪潮下,构建“超智一体”基础设施已成为产业升级的核心诉求。如今,“灵晟”国产超算依托超智融合体系架构创新,登顶全球超算 TOP500,并联合清程极智打造纯 CPU MoE 模型分布式推理方案,“灵晟”成功打破 HPC 与 AI 算力壁垒:既坐稳了科学计算的头把交椅,也在 AI 大模型推理中展现出卓越性能。它正在重新定义何为“好用、易用”的超智融合算力平台。

架构革新:“灵晟”筑就 AI 大模型推理新基石

为何要在超算上跑 AI?产业需求揭示了两大核心动因:一是方法融合,科学计算物理模型与数据驱动的 AI 深度结合,催生颠覆性科研成果;二是效能提升,超算平台通过错峰运行 AI 任务,最大化利用算力资源。以此为视角审视“灵晟”,其最大的亮点在于架构层面的原生超智融合。

●算力侧:不同于单纯堆砌专用加速卡的传统路径,“灵晟”在自研的 LX2 CPU 中引入矩阵加速单元并支持多精度,实现片上 HPC 算力与 AI 算力的深度融合。尤为关键的是,CPU 集成了片上内存(高带宽内存),可提供 TB 级带宽,相较传统 CPU 实现了十倍跃升,为大模型推理中的大批量并发处理提供了充足的带宽保障。

●网络侧:自研的“灵启”网络支持 μs 级低时延传输,具备可扩展至 200 万端口、10 万节点的超大规模组网能力。这种极低时延、极高扩展性的互联特性,有效消除了分布式推理中的通信瓶颈。

硬件创新只是第一步。“灵晟”LX2 CPU 与 GPU / NPU 架构存在本质差异,要将大模型从“专卡”平滑迁移至“通卡”,必须攻克软件层面的重重难关。

软硬协同:释放超智融合澎湃算力

HPC 与 AI 虽属不同计算范式,但在核心优化思路上却一脉相承 —— 均依赖算子优化、计算与访存重叠、流水线并行及多级并行等手段,以充分释放硬件性能。结合“灵晟”平台硬件特性及自研软件,清程极智从多个技术维度对大模型推理进行了深度加速。

1.面向“灵晟”LX2 CPU 的算子开发与优化

针对“灵晟”自研软硬件,清程极智完成了算子的重构:基于 LX2 CPU 的矩阵运算指令集,结合 OpenMP 与自研编译器实现计算算子;基于自研通信库构建通信算子。借助自研统一并行加速库 —— 该库具备计算图语义扩展、共享内存通信加速、多线程调度优化及硬件特性抽象等核心能力,清程极智实施精细化的指令序列控制,应用计算掩藏访存、异步流水线调度等优化策略。针对无依赖关系的多个算子,团队切分线程池,分布线程并行度,让少数线程负责并行度低的算子,多数线程负责并行度高的算子。例如 Shared expert 与 EP 通信同时进行,实测显示,MoE 推理时延 1440μs 大幅降低至 980μs。

2.面向“灵晟”集群的多层次并行推理优化

LX2 CPU 采用 NUMA 架构并集成片上内存,结合“灵启”网络的强劲互联能力,与 DeepSeek 大 EP(Expert Parallelism,专家并行)架构天然契合,具备极佳的集群扩展性。基于此,清程极智实施了多维度的并行策略优化:灵活配置张量并行(TP)、流水线并行(PP)、专家并行(EP)及数据并行(DP),构建多层次混合并行推理方案。在 DeepSeek 部署上,团队采用 EP256 的大规模专家并行配置,专家权重的全量分散部署,节点内 TP16,节点间 DP16,并针对 Attention 模块,设计了定制化混合并行策略,充分释放了 LX2 平台的算力密度与通信能力。

3. MTP(Multi-Token Prediction)技术加持

在上述优化基础上,清程极智引入了 DeepSeek MTP 加速技术,一次推理产生多个 token,再并行验证每个 token 否正确,显著提升了单请求的输出速率。团队还深入探究了不同并发规模下 MTP 加速比与预测深度的相关性,持续调优以实现最佳推理效果。

打破边界:引领超智融合新范式

基于“灵晟”多样性算力架构的创新与清程极智的 AI 推理加速技术,成功实现了 DeepSeek 模型的高效部署,率先实现纯 CPU MoE 模型分布式推理,16 节点即可流畅运行 DeepSeek-V3/R1-671B 模型,在 batch_size=2048 时,输出吞吐量与 80 张主流 GPU 集群相当。

针对规模化部署 DeepSeek 场景,“灵晟”研发团队正在基于 SGLang 推理引擎进行深度优化,最新测试数据显示,在 64 节点规模下处理长文本摘要任务时,TPOT(每输出 token 时延)在 55ms 内,单 CPU Decode 吞吐达 586.8 TPS;节点规模从 64 节点扩容至 8192 节点时,并行效率超过 74%,印证了“灵晟”系统极强的可扩展性

这意味着,“灵晟”不仅能同时支撑 HPC 与 AI 工作负载,更兼具卓越的性能表现与极高的经济性,这不仅从技术底层重塑了超智融合范式,更将以此为支点,为各行业复杂场景提供精准、高效的计算支撑,全面释放超智算力潜能,加速科研与产业数智化升级。

免责声明:本文为本网站出于传播商业信息之目的进行转载发布,不代表本网站的观点及立场。本文所涉文、图、音视频等资料之一切权力和法律责任归材料提供方所有和承担。本网站对此咨询文字、图片等所有信息的真实性不作任何保证或承诺,亦不构成任何购买、投资等建议,据此操作者风险自担。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。

华体会官方注册相关的文章

关键词:业界动态

软媒旗下网站: IT之家 最会买 - 返利返现优惠券 Win7之家 Win10之家

软媒旗下软件: 软媒华体会官方注册-华体会(中国)APP应用 魔方