AI 需求持續加速成長。工作負載規模越來越大、模型日益複雜,同時部署 AI 運算基礎設施的速度壓力也前所未有地增加。AI 工廠——將資料與能源持續轉換為智慧的大型資料中心系統——正被部署以滿足這股無止境的需求。

這種 AI 工廠式的資料中心運作方式,已從根本改變系統設計與營運模式。僅追求加速器峰值 FLOPS 已不再足夠。如今的 AI 工作負載,包括超過兆參數的模型、混合專家(MoE)架構、長上下文推理,以及解耦式服務,都需要大量加速器協同運作,形成單一運算單元。要達成此目標,需要高頻寬、低延遲的 GPU 對 GPU 通訊、快速的網路內集合運算,以及軟體感知的排程。

鑑於元件數量龐大,整個資料中心都需要內建韌性。要跟上 AI 的發展速度,需要能配合產業創新步伐的技術與供應鏈。

這就是為什麼規模擴展網路已成為 AI 工廠最重要的架構決策之一。規模擴展網路架構讓加速器能以單一運算單元運作,決定 token 如何在專家之間移動、集合運算完成的速度,以及工廠能提供的有效吞吐量。這也是營運商在部署新平台時,風險評估的重要關鍵。

NVIDIA NVLink 是專為 AI 工廠打造的規模擴展網路架構。它旨在加速 AI 推論、訓練,以及其他需要大型、高速 GPU 對 GPU 通訊的平行運算工作負載。第六代 NVLink 互聯技術搭配 NVLink 6 Switch,提供規模擴展網路中最高的 GPU 對 GPU 頻寬與最低延遲的全對全拓撲結構,同時支援 SHARP 網路內運算以卸載集合運算。它也內建機架層級的韌性功能,確保 AI 工廠的正常運作時間。

透過極致共同設計(從晶片、系統、網路架構到軟體皆一起設計與最佳化),NVLink 是 NVIDIA 年度 AI 基礎設施發展藍圖的一部分。這項成熟、經過驗證且廣泛部署的技術,已成為現代 AI 基礎設施的骨幹。

規模擴展網路如何決定 AI 工廠的經濟效益

規模擴展網路連接資料中心的伺服器,而規模擴展網路則讓單一領域內的 GPU 能以單一運算引擎的方式運作。兩者皆不可或缺,但解決的問題不同。

規模擴展網路架構如 NVIDIA Quantum InfiniBandNVIDIA Spectrum-X Ethernet,可建立涵蓋數千至數十萬個 GPU 的大型叢集。這對大型資料平行 AI 訓練工作負載(以及大規模科學模擬)至關重要。規模擴展網路則以高頻寬、可預測的低延遲,以及共享高頻寬記憶體(HBM)連接單一領域內的加速器。對現代 AI 訓練與推論而言,規模擴展領域正是大多數延遲敏感通訊模式發生的地方。

以 MoE 模型的推論為例。

高效的推論實作會使用 專家平行處理 將專家分配至不同 GPU,並使用大批次大小來最大化工廠吞吐量。這種方式雖然平行化了工作負載,但也會在 GPU 之間產生密集的全對全通訊。Token 必須被分派至選定的專家、處理、收集、重排序,再傳遞至下一階段。

所有 GPU 對 GPU 的通訊都必須平行進行。若專家位於低頻寬或高延遲的網路架構之後,專家平行處理帶來的效益可能會被通訊開銷抵銷。同樣的情形也會發生在 MoE 模型的訓練過程中。

結論是,全對全頻寬延遲對 AI 工廠的效能至關重要。AI 工廠需要專為規模擴展網路打造、與系統其他部分共同設計的技術,才能在各種工作負載下提供並維持這些效能。規模擴展網路可透過最佳化每瓦特、每美元與每平方英尺工廠面積所產生的 token 數,來提升投資報酬率。它能縮短訓練時間、提高利用率,並降低 AI 工廠的每 token 成本。

NVIDIA 已在大型 MoE 模型中展示高頻寬、低延遲規模擴展網路的影響。對於 DeepSeek-R1、Qwen 235B 等模型,以及模擬的 2T 參數 LLM,NVLink 可提供比市售(OTS)Ethernet 高達 2.3 倍的解碼吞吐量。

A bar chart comparing relative LLM decode throughput in tokens per second per accelerator for NVLink 6 and off-the-shelf Ethernet across three different models sampled at various interactivity points. The speedups for NVLink 6 are 2X for a 2T parameter model at 80 tps per user, 2.1X for DSR1 at 300 tps per user, and 2.3X for Qwen 235B at 120 tps per user.
圖 1. 第六代 NVLink 相較於市售 Ethernet,可提供高達 2.3 倍的解碼吞吐量(72 個加速器規模擴展領域)結果基於模擬

評估規模擴展技術

規格表通常使用簡單的頻寬數字來比較網路架構:連結速率、交換器總容量,或是裝置的標題頻寬。這些數字雖然有用,但並不充分。

評估當前 AI 工作負載的規模擴展能力,需要從工廠層級的角度來看待。已實現的全系統效能決定了單位時間、功率與工廠面積能處理與產生的 token 數量。這取決於全對全網路頻寬、端到端延遲(即從每個 GPU 的 HBM 記憶體,經由網路架構,到其他 GPU 的 HBM 記憶體的延遲)、用於歸約與其他集合運算的網路內運算。它也需要每個層級都具備成熟且完整整合的軟體,才能最佳化路由、暴露集合運算、平衡連結流量、管線化資料傳輸,並完整支援當前 AI 工作負載所使用的函式庫與框架。

已實現效能的重要性,取決於工廠是否能持續運作。能夠長時間無故障運行、持續監控系統健康狀態,以及在其他工廠繼續運作的情況下支援元件層級的服務與維護的能力,將已實現效能轉化為有效產出(goodput)——即工廠在其整個生命週期內的產能。

透過複雜技術在多種工作負載中達成最佳已實現效能與有效產出,是一項極具挑戰性的任務,需要多年來從廣泛部署的規模擴展基礎設施與穩健供應鏈中累積的經驗。使用未經驗證的技術堆疊,或非專為規模擴展網路打造的解決方案,可能導致次佳的工廠效能、破壞性停機事件,以及不可靠的供應。

這些指標共同驅動唯一重要的結果:AI 工廠在其生命週期內持續且可靠的投資報酬率。

AI 工廠規模擴展網路的關鍵指標

已實現效能工廠韌性平台成熟度與經驗證的供應鏈
當前 AI 工作負載的已實現工廠效能,從頻寬與延遲開始,但也包含端到端規模擴展網路效能、用於歸約與其他集合運算的網路內運算,以及成熟且完整堆疊的軟體實作,整合至解決方案的每個部分。將已實現效能轉化為有效產出,需要系統層級的韌性,包括長時間正常運作、持續的系統健康監控與遙測,以及在工廠其他部分繼續運作的情況下,支援元件層級的服務與維護。擴展 AI 工廠是一項極其複雜的挑戰,涉及許多依賴關係。營運商希望透過利用成熟的技術堆疊,以及經過驗證的大規模部署與已實現投資報酬率的長期記錄,來降低風險。
表 1. 這三項關鍵指標對於評估規模擴展網路解決方案至關重要。

NVLink:效能、韌性、成熟度

NVLink 現已進入第六代,提供最大化工廠有效產出所需的已實現效能與韌性,並擁有超過十年的規模擴展技術投資,以及包含全球領先超大規模業者、雲端服務供應商(CSP)與超級運算中心的經驗證部署。

世界領先的效能

搭配 Vera Rubin NVL72,第六代 NVLink 提供每 GPU 3.6 TB/s 的雙向 GPU 對 GPU 頻寬,以及 72 GPU 領域內 260 TB/s 的機架層級 GPU 頻寬。GPU 對 GPU 傳輸的端到端延遲比基於市售 Ethernet 的替代方案低 3 倍,封包速率則高 10 倍。

3X 更低延遲

10X 更高封包速率

130 TFLOPS 網路內運算

第六代 NVLink 相較於基於市售 Ethernet 的替代方案,提供更低延遲與更高封包速率的 GPU 對 GPU 傳輸,以及用於集合運算的網路內運算能力

NVLink Switch tray 與由 5,000 條纜線組成的 NVLink 脊柱,形成單一全對全拓撲結構,讓任何 GPU 都能以一致的延遲與頻寬與其他 GPU 通訊。每個 tray 包含四個 NVLink 6 交換器晶片、28.8 TB/s 的總 tray 頻寬,以及 14.4 TFLOPS 的 FP8 網路內運算。在單一 Vera Rubin NVL72 機架中,NVLink 6 提供 260 TB/s 的總頻寬,以及 130 TFLOPS 的網路內運算,用於加速歸約與其他集合運算(例如 all-reduce、reduce、broadcast 等)。

NVLink 技術藍圖包含對高達 1152 個 GPU 的規模擴展領域大小,以及透過共封裝光學元件的連接支援。

A front view of the Vera Rubin NVL72 rack alongside a top-down view of Vera Rubin NVL72 Switch Tray, which includes 4 sixth-generation NVLink Switch chips.
圖 2. Vera Rubin NVL72 NVLink 脊柱、機架與 NVLink 6 Switch tray 提供 260 TB/s 的全對全頻寬(每 GPU 3.6 TB/s),以及 130 TFLOPS 的網路內運算

軟體是規模擴展網路堆疊的關鍵組成部分,包括 NVIDIA Dynamo、NVIDIA TensorRT-LLM、NVIDIA Collective Communications Library (NCCL) 等(詳見平台成熟度章節),這些軟體皆建構於 NVIDIA CUDA 之上——這個近 20 年前首次發布的世界領先平行運算平台。

硬體與軟體透過 極致共同設計 進行開發。這帶來單獨堆疊元件無法達成的效能加速。對於當前的 AI 工作負載而言,這直接轉化為基礎設施的經濟效益。

舉例來說,從 NVIDIA Hopper 轉換至 NVIDIA Blackwell 的過程中,包括將 NVLink 頻寬加倍、將 NVLink 規模擴展領域從 8 個 GPU 擴展至 72 個,以及整合 Dynamo 用於解耦式推論,NVIDIA 達成了每瓦特 MoE 推論效能提升 50 倍的成果。

NVIDIA Vera Rubin 平台 進一步將 NVLink 頻寬與網路內運算能力加倍。

Line chart comparing token throughput efficiency (tokens/second/MW) vs. interactivity (tokens/second) for NVIDIA GB300 NVL72 NVFP4 and H200 FP8. At ~120 tokens/second of interactivity, the GB300 NVL72 delivers ~50x more tokens per watt than the H200.
圖 3. 透過將 72 個 GPU 以高頻寬、低延遲的規模擴展領域連接,並搭配網路內運算,NVLink 讓 GB300 NVL72 相較於 H200 達成 50 倍的 token/瓦特改善

隨著模型架構演進,硬體網路架構與軟體通訊堆疊也同步演進。這種極致共同設計的開發方式,需要整個堆疊的緊密協作。這無法透過孤立的開發方式複製,特別是在超大規模部署壓力下,但這正是單純增加加速器與擴展至實用已實現效能之間的差異。

兼具速度智慧韌性

AI 工廠必須持續運作。隨著機架密度與價值提升,可維護性與故障管理成為效能方程式的一部分。提供高頻寬但需要破壞性維護的網路架構,可能降低有效容量與營收。

NVLink 6 導入專為 AI 工廠營運設計的管理與智慧韌性功能。這些功能讓機架維護更為容易、提供更好的元件效能與負載平衡洞察,並讓工廠在個別節點需要服務或更新時仍能持續運作。

第六代 NVLink Switch 支援以下智慧韌性功能,以最大化正常運作時間與有效產出:

  • 控制平面韌性
  • 支援部分填入機架的運作
  • 熱插拔交換器 tray
  • 具備管理控制器備援的軟體定義路由
  • 動態流量重新路由
  • 線上軟體更新
  • 用於監控與故障歸因的精細連結遙測

這些功能並非次要。在生產型 AI 工廠中,單一連結、交換器、tray 或管理控制器的故障,不應導致整個機架停止服務。營運商需要與基礎設施經濟價值相符的故障隔離、遙測與服務程序。NVLink 6 將規模擴展網路帶入與 AI 工廠堆疊其他部分相同的營運紀律。

成熟技術搭配快速發展節奏

最強大的技術策略結合成熟度與速度。NVLink 兩者兼具。

NVLink 現已進入第六代專為規模擴展網路打造的網路架構。它已在大規模生產環境中部署近十年,數百萬顆 NVIDIA 晶片部署於支援 NVLink 的系統,以及伺服器、機架、纜線、交換器、軟體與營運工具的生態系統。

NVIDIA 年度平台發展節奏,以配合 AI 創新的速度交付新的硬體能力,讓產業能快速部署新模型與工作流程,以滿足全球的 AI 需求。

除了硬體之外,NVIDIA 與社群也將軟體作為規模擴展網路堆疊的關鍵元件發布。這些包括:

  • Dynamo用於在多節點 GPU 環境中擴展生成式 AI 與推理模型的開源框架,支援解耦式服務、動態 GPU 配置、KV-cache 感知路由,以及基於 NIXL 的資料移動。
  • TensorRT-LLM用於 NVIDIA GPU 上高效 LLM 推論的開源 NVIDIA 函式庫,使用最佳化核心、運算/通訊重疊,以及 NVFP4 與 FP8 等低精度格式來提升吞吐量,包括 MoE 模型。
  • NIXL用於在 GPU 記憶體、CPU 記憶體、NVMe 與遠端儲存之間進行快速資料傳輸的開源 NVIDIA 函式庫,幫助在分散式系統中有效移動 KV-cache 與推論狀態。
  • NCCL:用於高速 GPU 通訊的開源 NVIDIA 函式庫,擁有超過 10 年的開源創新。包含拓撲感知集合運算、AI 框架整合,以及用於網路內歸約與其他集合運算的 SHARP 支援。
  • 網路架構與記憶體管理:包含位址空間管理 API、可擴展記憶體語意,以及用於高效 HBM 存取的內建記憶體一致性。

軟體創新在硬體發布後持續進行,在產品生命週期內實現指數級加速。

NVLink-C2C 將網路架構延伸至 CPU

AI 工廠需要的不僅是 GPU 對 GPU 頻寬。它們也需要高頻寬、具一致性的 CPU-GPU 連接,用於協調、資料移動、記憶體管理、儲存服務,以及混合運算階段的代理式工作負載。

NVIDIA NVLink-C2C 提供此路徑。搭配 Vera Rubin NVL72 平台中的 Vera CPU,NVLink-C2C 提供 CPU 與 GPU 之間 1.8 TB/s 的一致性頻寬,是 PCIe Gen6 的 7 倍。這支援高速資料共享,以及跨越 CPU 與 GPU 記憶體的統一一致性記憶體架構。對於基礎設施團隊而言,這意味著控制、記憶體與運算之間的瓶頸減少。對於軟體團隊而言,這簡化了程式設計模型,並支援 KV-cache 卸載、多模型執行、資料處理與代理式協調等工作負載。

Vera 本身就是為此角色而設計,配備 88 個 NVIDIA 自訂 Olympus 核心、高記憶體頻寬,以及適合 AI 工廠工作負載的節能運作。在 NVIDIA 平台中,CPU、GPU、NVLink、HBM、系統記憶體、網路與軟體皆經過共同設計以最佳化效能。

NVLink Fusion:無需從頭開始的半客製 XPU 基礎設施

超大規模業者與 AI 原生業者會針對特定工作負載與客戶需求打造專用晶片,但他們在部署時面臨多項挑戰。整合最先進的規模擴展網路、設計與部署完整的機架規模架構、在晶片供應風險中承諾資料中心設計,以及支援異質基礎設施,每項都帶來獨特的困難。

NVIDIA NVLink Fusion 提供此路徑。NVLink Fusion 是高頻寬、低延遲的互聯技術與 IP,可將客製晶片連接至 NVIDIA 世界領先的 AI 基礎設施平台。透過 NVLink Fusion,他們可利用經驗證的 NVLink 規模擴展堆疊與生態系統,降低開發與部署複雜度、提升效能,並加速半客製 AI 工廠的上市時間。透過標準化單一統一架構,NVLink Fusion 簡化整個資料中心的營運、支援資料中心容量的彈性重新配置,並讓客製 AI XPU 能與 GPU 無縫整合以進行解耦式運算。

這打破了基本限制,消除了在客製 XPU 與世界級 AI 平台之間做出選擇的必要性。由於 NVLink Fusion 與 NVIDIA 技術藍圖同步發展,採用者也能跟上 NVIDIA 的年度發展節奏。

生產型 AI 工廠的發展路徑

未來的 AI 工廠不會由最快的獨立加速器贏得勝利。它將由能在最快發展節奏下,以最低每 token 成本交付最多智慧,且部署風險最低的基礎設施贏得勝利。

NVLink 提供領先的效能,包括比替代方案低 3 倍的延遲與高 10 倍的封包速率,以及 130 TFLOPS 的網路內運算、工廠韌性功能,以及成熟且經驗證的平台。AI 工廠正成為 AI 運算時代的定義性基礎設施。NVLink 提供驅動它們所需的效能、可操作性、成熟度與持續創新。

了解更多關於 NVIDIA Vera Rubin 平台NVLinkNVLink Fusion 的資訊。