![]()
7月22日消息,在GTC 2026正式發布之后,英偉達(NVIDIA)近日首次完整公開了Rubin AI GPU架構的技術細節。作為下一代AI數據中心平臺的核心計算芯片,Rubin不僅承擔著接替Blackwell的使命,也將成為未來Agentic AI(智能體AI)時代的重要算力基礎。
根據英偉達公布的數據,相比Blackwell架構,Rubin在單位能耗下的Agentic AI推理吞吐量提升最高可達10倍。這一性能躍升主要來自三項關鍵架構創新:全新增強版Tensor Core(張量核心)、 新一代HBM4高帶寬內存子系統、第三代Transformer Engine(Transformer引擎)。
![]()
采用雙裸片設計,集成3360億顆晶體管
Rubin GPU采用臺積電(TSMC)3nm N3P制程工藝制造,由兩顆達到光罩尺寸上限(Reticle Limit)的GPU裸片組成,并通過英偉達自研的NV-HBI(High-Bandwidth Interface)高速互連技術封裝為一顆完整GPU。
整個Rubin GPU共集成約3360億顆晶體管,較Blackwell GB300增加約62%,也是目前業內集成度最高的AI GPU之一。
從架構來看,每顆Rubin GPU包含:8個GPC(Graphics Processing Cluster,圖形處理集群)、224個SM(Streaming Multiprocessor,流式多處理器)、896個Tensor Core(張量核心)。
按照平均計算,每個GPC約擁有28個SM和112個Tensor Core。不過從官方框圖來看,Rubin實際上采用了兩種不同配置的GPC,一種集成30個SM,另一種集成26個SM。
![]()
每顆裸片內部包含4個GPC,同時連接:大容量分布式L2 Cache、Gigathread Engine、4組HBM4內存控制器(每裸片4096-bit)和NVLink接口。
此外,Rubin還集成了:
PCIe Gen6控制器,用于連接主機CPU;
第六代NVLink IO,可提供最高3600GB/s GPU互連帶寬;
MIG(Multi-Instance GPU)控制器,實現GPU資源切分;
NVDEC視頻解碼單元;
![]()
基于TEE-I/O(Trusted Execution Environment)的Confidential Computing(機密計算)能力,可保障AI工作流中數據靜態、傳輸及運行過程中的安全。
首次采用HBM4,帶寬高達22TB/s
內存子系統是Rubin最大的升級之一。Rubin首次采用HBM4高帶寬內存,共配置8組12-Hi堆疊,總容量達到288GB。
具體來看,8組12-Hi HBM4,每組容量36GB,單顆DRAM容量3GB,總容量288GB,整體峰值帶寬達到22TB/s,是目前英偉達最快的HBM內存方案。相比Blackwell約8TB/s帶寬,Rubin實現約2.8倍提升。
![]()
與此同時,Rubin還配備升級版Tensor Memory Accelerator(TMA),進一步優化GPU內部復雜數據搬運效率。
整個數據傳輸體系包括:
HBM4:22TB/s
NVLink 6:GPU之間3600GB/s
NVLink-C2C:CPU-GPU之間1800GB/s
PCIe Gen6 x16:256GB/s
HBM4顯著提升Token生成效率
隨著大語言模型參數不斷增長,模型推理越來越受到內存帶寬限制。英偉達表示,目前AI推理普遍面臨更長Context窗口、更大的KV Cache、更高并發Token生成。HBM4的大帶寬可有效解決上述瓶頸。
具體而言,容量提升意味著,可容納更大模型常駐顯存、支持更長上下文窗口、支持更大的KV Cache、提高推理并發能力、減少KV Cache外存交換。
帶寬提升則意味著,提高Token逐個生成階段的數據供給速度、避免Tensor Core等待數據、提高GPU利用率。
此外,升級后的TMA及內存局部性優化策略,可進一步提高復雜數據布局下的有效帶寬利用率。
英偉達表示,HBM4使Rubin能夠支持未來多萬億參數模型、更長上下文推理以及高并發Agentic AI工作負載。
全新Tensor Memory Accelerator優化MoE模型推理
針對目前廣泛應用的MoE(Mixture of Experts,混合專家)模型,Rubin進一步增強了Tensor Memory Accelerator(TMA)。
隨著MoE模型專家數量不斷增加,專家權重的數據定位與搬運成為新的性能瓶頸。
新版TMA通過優化描述符(Descriptor)管理機制,可更高效地定位和調度專家權重,減少數據搬運開銷。
同時,Rubin新增Inline Descriptor支持,使多個Tensor共享統一描述信息,僅需在運行過程中動態修改內存地址、Stride等參數即可完成調度。
![]()
英偉達表示,這一改進可使MoE模型在專家數量進一步增加后仍保持較高擴展效率,并將更多GPU計算資源用于推理計算,從而提升整體吞吐能力。
Tensor Core吞吐翻倍,Transformer推理進一步加速
Rubin另一項核心升級來自Tensor Core。新版Tensor Core單個時鐘周期可處理的數據量翻倍,其主要通過擴大Tensor計算中的K維數據處理能力實現。
以矩陣乘法(GEMM)為例:在Blackwell上需要執行4輪K循環,而Rubin僅需2輪即可完成相同計算。這不僅提升計算吞吐,也降低了Kernel調度延遲。與此同時,Rubin進一步優化了Transformer中的Attention計算流程。
![]()
據官方介紹,其采用Activation Sparsity(激活稀疏)結合Adaptive Compression(自適應壓縮)技術,可將Attention Score壓縮為結構化2:4稀疏格式,僅保存非零數據及對應元數據。
![]()
這樣既減少Attention Score寫入與存儲開銷,也降低后續Attention計算的數據傳輸量,同時保持最終輸出仍為標準Dense格式,無需修改模型結構。
此外,Rubin還提升了Softmax及指數運算(Exponential)性能。
不同精度下計算能力提升如下:
FP32吞吐達到GB300水平,是GB200的2倍;
BF16/FP16吞吐相比GB200提升4倍,相比GB300提升2倍。
更低Kernel延遲,更適合Agentic AI推理
Rubin還增強了GPU內部Kernel之間的調度協同能力。傳統GPU通常需要等待上一階段Kernel全部完成后再啟動下一階段計算,而Rubin允許后續Kernel在所需輸入數據準備完成后即可提前啟動。
![]()
這樣能夠減少GPU空閑時間、提高不同Kernel執行重疊度、提升流水線利用率。英偉達認為,這對于Agentic AI推理尤為重要。
由于Agentic AI任務通常需要模型逐步生成Token,各Kernel之間存在連續依賴關系,Kernel間延遲將直接影響單用戶Token生成速度(Tokens/s)。
DSX MaxLPS進一步優化AI數據中心能效
除了GPU本身,Rubin平臺也針對數據中心能效進行了大量優化。
以Vera Rubin NVL72系統為例,其新增了Dynamic Power Steering(動態功率調度)和Intelligent Power Smoothing(智能功率平滑)。系統通過集成儲能模塊,可吸收GPU瞬時功率波動。
![]()
英偉達表示,相較上一代平臺平均功耗降低約10%,50毫秒峰值功耗降低約20%。從而使整個AI服務器能夠更穩定運行于最大功率區間,提高整體Token輸出效率。
此外,英偉達還推出DSX OS操作系統,其中集成DSX MaxLPS,可統一管理GPU、機柜、液冷系統以及AI工作負載,實現調度、生命周期管理及健康狀態自動化。
![]()
官方數據顯示,在相同供電預算下,DSX MaxLPS可支持部署約40%更多GPU資源,從而進一步提升AI數據中心整體算力密度和推理吞吐能力。
小結
從3360億顆晶體管的雙裸片設計,到首次引入HBM4內存、增強版Tensor Core、第三代Transformer Engine,以及圍繞MoE模型、Agentic AI推理和數據中心能效所進行的一系列架構優化,Rubin代表著英偉達AI GPU的一次全面升級。
可以看出,相較于Blackwell主要面向大模型訓練和通用推理,Rubin的設計重點已經明顯轉向以智能體(Agentic AI)為代表的新一代AI應用場景,通過提升Token生成效率、降低推理延遲、優化內存帶寬利用率及提高單位能耗算力輸出,為未來更大規模、更高并發、更長上下文的大模型部署奠定硬件基礎。
編輯:芯智訊-浪客劍
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.