首页 > 软硬件>英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

快科技软硬件2026-07-23 07:20:29
快科技7月22日消息,英伟达宣布Blackwell GB300刷新MoE预训练世界纪录。使用256块GPU训练DeepSeek-v3 671B模型,每GPU吞吐达1648 TFLOPs。相比去年11月的1088 TFLOPs,GB300性能优化提升50%。...

最新7月22日消息,英伟达宣布Blackwell GB300刷新MoE预训练世界纪录。使用256块GPU训练DeepSeek-v3 671B模型,每GPU吞吐达1648 TFLOPs。

相比去年11月的1088 TFLOPs,GB300性能优化提升50%。与上一代GB200的606 TFLOPs相比,实现了约3倍的性能跃升。

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

这一成绩来之不易。英伟达在过去6个多月模拟了超过25万种配置,为Blackwell摸索出38项重大优化方案,累计进行了140万小时的GPU测试。

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

需要提及的是,MoE即混合专家模型,将大模型分割为多个专家子网络。每次推理或训练仅激活其中一部分,以更低计算成本实现更大模型容量,是当前大语言模型的主流架构。

英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%

GB300 NVL72用更少的GPU硬件就达到相同训练性能。这意味着AI训练成本将进一步下降,对大模型厂商是实实在在的利好。

英伟达表示通过系统级优化的持续挖掘,Blackwell架构仍有性能提升空间。这轮优化成果将直接惠及所有使用GB300的AI训练集群。

对DeepSeek这类大模型厂商而言,GB300带来的算力提升意味着更短训练周期和更低成本。1648 TFLOPs的单GPU算力足以支撑更大规模模型的快速迭代。

《英伟达GB300再破世界纪录!256块GPU跑DeepSeek-v3:算力提升50%》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。

本文网址:https://www.jsj.wang/2026/07/17847624453626.html

相关图文