零GPU跑通DeepSeek!中国超算用CPU打了一场翻身仗:16节点顶80张显卡
快科技8月7日消息,据报道,全球排名第一的国产超算“灵晟”成功完成纯CPU架构下的MoE模型分布式推理部署。该超算仅用16个计算节点即可流畅运行DeepSeek-V3/R1-671B满血模型,在并发数...
最新8月7日消息,据报道,全球排名第一的国产超算“灵晟”成功完成纯CPU架构下的MoE模型分布式推理部署。该超算仅用16个计算节点即可流畅运行DeepSeek-V3/R1-671B满血模型,在并发数batch_size=2048时,输出吞吐量与80张主流GPU集群相当。
这意味着纯国产CPU架构首次在大模型推理领域实现了对GPU集群的正面抗衡,彻底颠覆了“跑大模型必须用GPU”的传统认知。

灵晟超算最独特之处在于其纯CPU架构路线。它没有采用堆砌GPU或专用加速卡的传统方案,而是在自研的LX2 CPU中直接集成了矩阵加速单元,支持多精度计算,让每颗CPU都能同时处理超算科学计算与AI推理任务。
这种片上融合的设计消除了CPU与加速卡之间数据搬移的开销。不过计算能力只是第一步,大模型推理的真正瓶颈在于内存带宽,模型参数需要频繁在计算单元和内存之间搬运。
为此LX2 CPU集成了首颗国产高带宽内存(HBM),总带宽达4TB/s,相比传统CPU内存带宽提升10倍。搭配自研的“灵启”高速网络,支持微秒级时延与10万节点组网,扫清了计算、带宽和通信三大障碍。

实测显示,经优化后MoE推理时延从1440微秒大幅降低至980微秒。该团队还引入了DeepSeek多token预测加速技术,进一步提升了输出速率。
此次突破表示,灵晟超算不再只服务于传统科学计算,已正式纳入国产AI大模型的生产服务体系。
值得一提的是,今年6月23日,灵晟超算在德国汉堡ISC2026大会上正式登顶全球超算TOP500榜单,这是时隔九年中国超算再次排名全球第一。

《零GPU跑通DeepSeek!中国超算用CPU打了一场翻身仗:16节点顶80张显卡》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
斥资107亿美元!南亚科技建DRAM新厂
快科技8月7日消息,据媒体报道,DRAM大厂南亚科技近日召开董事会,正式宣布将新建一座5A晶圆厂,总投资上限高达3466亿新台币(约合107.34亿美元)。根据规划,5A晶圆厂将分阶段推进,建设周期... -
新核显藏不住了!AMD GFX1171代码现身Mesa:为下一代锐龙APU准备
快科技8月7日消息,AMD近日将GFX1171目标代码并入开源图形栈Mesa 26.3,为下一代核显铺路。该代码为RADVulkan与RadeonSI的OpenGL驱动提供支持。GFX1171是AMD代号RDNA 4m的图形架构,归属GFX11... -
3万块的卡真烧不起!玩家自制RTX 5090防烧接口神器:电流过载立即强制关机
快科技8月7日消息,一名RTX 5090玩家近日在GitHub上分享了一款开源软件工具,用来预防RTX 5090显卡在高负载下可能导致16针接口熔毁的问题。该软件能够实时监测显卡接口电流,一旦发现过载风险便... -
游戏显存占用骤降85%!英伟达NTC压缩技术杀入RTX Spark:6.5GB缩到970MB
快科技8月7日消息,英伟达将神经网络纹理压缩NTC技术接入Windows on Arm设备,正式适配RTX Spark平台,将游戏显存占用最高压缩为原有的约1/7。NTC是一种AI驱动的纹理压缩方式,通过GPU张量核心... -
显卡涨价潮中的一股清流!七彩虹RTX 5060直降530元:到手价3899元
快科技8月7日消息,当前显卡市场正经历一轮全线涨价,GDDR7显存颗粒采购成本持续攀升,英伟达已向各大合作伙伴发出GPU套件涨价通知。就在一片涨声中,七彩虹反其道而行,将iGame RTX 5060 Adv...












