英伟达公开 Rubin GPU 细节:3360 亿晶体管,智能体 AI 性能较 Blackwell 提升 10 倍
最新 7 月 22 日消息,英伟达今天(7 月 22 日)发布博文,公开 Rubin GPU 架构细节。该 GPU 基于台积电 3nm 工艺,集成 3360 亿个晶体管,在智能体 AI 性能方面,比 Blackwell 提升 10 倍。
架构方面,英伟达表示 Rubin GPU 采用台积电 3nm(N3P)工艺制造,由两块光罩极限尺寸 Die 实现高密度和高效率特性,这 2 个 Die 通过 NVIDIA 高带宽接口(NV-HBI)连接成统一封装,总计集成 3360 亿晶体管,较 Blackwell GB300 芯片增加 62%。

每个 Rubin GPU 内部包括 8 个 GPC(图形处理集群),总计 224 个 SM(流式多处理器)和 896 个 Tensor Cores。根据方框图,存在两种类型的 GPC:一种包含 30 个 SM,另一种包含 26 个 SM。
每个 Die 上配有 4 个 GPC,它们连接着两组大型去中心化 L2 缓存、一个 Gigathread Engine、四个 HBM 通道(每个芯片 4096 位)和一个 NVLink 接口。
NVLink 6 提供 3600 GB/s 的 GPU 间互联带宽,NVLink-C2C 接口提供 1800 GB/s 的 CPU 至 GPU 通信带宽,PCIe Gen6 x16 通道则提供 256 GB/s 的主机连接带宽。
在性能指标方面,NVIDIA 官方数据显示,针对智能体 AI 工作负载,Rubin 的单位能耗吞吐量达到 Blackwell 的 10 倍。

该提升源自三项主要架构变更:增强型张量核心(Tensor Cores)支持扩展精度、全新 HBM4 内存子系统以及第三代 Transformer 引擎。
内存系统方面,Rubin 搭载 8 个 12-Hi 堆栈的 HBM4 内存,总容量 288 GB,单堆栈容量 36 GB,峰值带宽达 22 TB/s,较 Blackwell 的 8 TB/s 提升了 1.8 倍。

该内存方案支持更大上下文窗口、更高并发量,并在逐令牌生成阶段确保模型权重与 KV 状态的高速移动。



《英伟达公开 Rubin GPU 细节:3360 亿晶体管,智能体 AI 性能较 Blackwell 提升 10 倍》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
超 60% 的 V-NAND 产能给英伟达,三星加速 V9、V10 闪存布局
韩媒 sedaily 于 7 月 20 日发布博文,报道称在 NAND Flash 闪存供应方面,三星正扩大和英伟达的合作,延伸到 V-NAND(垂直 NAND)。... -
微星带来神影 16 魔龙姬限定款锐龙版游戏本:8940HX + 5060
其采用星云白配色并装饰以幻彩渐变龙盾徽标与魔龙姬家族徽章,标配 16GB DDR5 SO-DIMM 内存和 512GB PCIe Gen 4 SSD 存储,补贴后到手价 9499 元。... -
联想来酷 Pro 14 轻薄本上市:酷睿 / 锐龙双版本低至 4929.15 元
其搭载英特尔酷睿 Ultra 5 处理器 135H 或 AMD 锐龙 7 H 255 处理器,配备 24GB 内存和 512GB 存储。... -
AMD 锐龙 5 7430U 款联想来酷 AI MINI 迷你主机上架,2999 元
其配备 16GB DDR4 SO-DIMM 内存和 512GB M.2 PCIe SSD 存储,预留第二 M.2 SSD 盘位,内置 Wi-Fi 5 (802.11ac) 无线网卡,包含 2 个 1GbE RJ45。... -
曝 Meta 定制版 AMD MI450 架构 GPU 仅具备 1/2 计算单元和 1/3 显存容量
该定制版本旨在提升机架级系统中的 CPU:GPU 算力比例,改善内存带宽效费比,但不利于 LLM 训练 / 推理负载。...












