AI 需求持续加速。工作负载规模不断扩大,模型日益复杂,同时部署 AI 计算基础设施的速度压力也前所未有。AI 工厂——将数据和能源持续转化为智能的数据中心级系统——正在部署以满足这种无止境的需求。
这种面向数据中心的 AI 工厂方法从根本上改变了系统设计和运维方式。仅依靠加速器峰值 FLOPS 已不再足够。今天的 AI 工作负载,包括万亿参数以上模型、混合专家(MoE)架构、长上下文推理以及解耦式服务,需要众多加速器作为一个统一的计算单元协同工作。实现这一目标需要高带宽、低延迟的 GPU 到 GPU 通信、网络内计算支持集合操作,以及与软件感知的调度。
鉴于组件数量庞大,韧性必须内置于整个数据中心。跟上 AI 步伐需要技术和供应链能以行业创新的速度推进。
这正是扩容网络成为 AI 工厂最重要架构决策之一的原因。扩容网络使加速器能够作为一个统一的计算单元工作,决定令牌在专家间移动的效率、集合操作完成的快慢,以及工厂能交付的有效吞吐量。它也是运营商部署新平台时承担风险的重要因素。
NVIDIA NVLink 是专为 AI 工厂打造的扩容网络结构。它旨在加速需要大规模、高速 GPU 到 GPU 通信的 AI 推理、训练及其他并行计算工作负载。第六代 NVLink 互连与 NVLink 6 交换机提供最高 GPU 到 GPU 带宽、最低延迟的全互联拓扑,用于扩容网络,同时支持 SHARP 网络内计算以卸载集合操作。它还包含为生产级 AI 工厂正常运行时间设计的机架级韧性特性。
通过从芯片到系统、到网络结构、再到软件的极致协同设计,NVLink 属于 NVIDIA 年度 AI 基础设施路线图节奏的一部分。这项成熟、经过验证且广泛部署的技术构成了现代 AI 基础设施的骨干。
扩容网络如何决定 AI 工厂的经济效益
扩容网络连接数据中心内的服务器。扩容网络使域内的 GPU 能够作为一个统一的计算引擎运行。两者都必不可少,但解决不同问题。
扩容网络如 NVIDIA Quantum InfiniBand 和 NVIDIA Spectrum-X Ethernet 支持跨越数千到数十万 GPU 的大规模集群。这对大规模数据并行 AI 训练工作负载(以及大规模科学模拟)至关重要。扩容网络则以高带宽、可预测低延迟和共享高带宽内存(HBM)将单个域内的加速器连接起来。对于现代 AI 训练和推理,扩容域是大多数延迟敏感通信模式发生的地方。
以 MoE 模型推理为例。
高效推理实现使用专家并行将专家分布到各 GPU,并使用大批量大小最大化工厂吞吐量。这实现了工作负载并行化,但也产生了 GPU 之间的密集全互联通信。令牌必须分发到选定专家、处理、收集、重排序并继续传递。
所有 GPU 到 GPU 通信必须并行发生。如果专家位于低带宽或高延迟网络之后,专家并行带来的收益可能被通信开销抵消。MoE 模型训练也会出现相同现象。
结论是:全互联带宽和延迟对 AI 工厂性能至关重要。AI 工厂需要专为扩容网络打造、与系统其余部分协同设计的网络结构,以在负载下跨所有工作负载交付并维持这些能力。扩容网络通过优化每瓦特、每美元和每工厂平方英尺交付的令牌数量来提高 ROI。它带来更短训练时间、更高利用率和更低的 AI 工厂每令牌成本。
NVIDIA 已在大型 MoE 中展示了高带宽、低延迟扩容网络的影响。对于 DeepSeek-R1、Qwen 235B 等模型以及模拟的 2T 参数 LLM,NVLink 相比主流现成(OTS)Ethernet 提供高达 2.3 倍的解码吞吐量。

评估扩容技术
规格表通常使用简单带宽数字比较网络结构:链路速率、交换机总容量或设备标称带宽。这些数字有用,但不足够。
评估当今 AI 工作负载的扩容能力需要采用工厂级视角。交付的系统级性能决定单位时间、功率和工厂占地能处理和生成多少令牌。它取决于全互联网络带宽、端到端延迟(即从每个 GPU 的 HBM 内存经网络到其他 GPU HBM 内存的延迟)、用于规约和其他集合操作的网络内计算。同时还需要在解决方案各层级完全集成的软件,能优化路由、暴露集合操作、平衡链路流量、流水线化数据传输,并完全支持当今 AI 工作负载使用的库和框架。
交付性能的价值取决于工厂能否正常运行。能够长时间无故障运行、持续监控系统健康状况、支持在工厂其余部分继续运行时进行组件级服务和维护,将交付性能转化为有效产出——即工厂在其全生命周期内的生产能力。
通过复杂技术在众多工作负载中实现最优交付性能和有效产出是一项极具挑战性的任务,需要依靠多年大规模部署经验和稳健供应链来解决。使用未经验证的技术栈或非专为扩容网络打造的解决方案,存在工厂性能次优、破坏性停机事件和不可靠供应的风险。
这些指标共同驱动唯一重要的结果:AI 工厂在其生命周期内实现持续、可依赖的 ROI。
AI 工厂扩容网络的关键指标
| 交付性能 | 工厂韧性 | 平台成熟度与经验证供应链 |
| 当今 AI 工作负载的工厂交付性能始于带宽和延迟,但还包括端到端扩容网络性能、用于规约和其他集合操作的网络内计算,以及贯穿解决方案各部分的成熟全栈软件实现。 | 将交付性能转化为有效产出需要系统级韧性,包括长时间正常运行、持续系统健康监控与遥测,以及支持在工厂其余部分继续运行时进行组件级服务和维护。 | 扩展 AI 工厂是一项极其复杂的挑战,存在众多依赖项。运营商希望通过利用具有大规模部署和实现 ROI 经验证长期记录的成熟技术栈来降低风险。 |
NVLink:性能、韧性、成熟度
现已进入第六代,NVLink 提供最大化工厂有效产出所需的交付性能和韧性,并拥有十余年扩容技术投入和经验证部署,包括世界领先的超大规模运营商、云服务提供商(CSP)和超级计算中心。
世界领先性能
在 Vera Rubin NVL72 中,第六代 NVLink 提供每 GPU 3.6 TB/s 双向 GPU 到 GPU 带宽,以及 72-GPU 域内 260 TB/s 的机架级 GPU 带宽。GPU 到 GPU 传输的端到端延迟比基于现成 Ethernet 的替代方案低 3 倍,包速率高 10 倍。
3X 更低延迟
10X 更高包速率
130 TFLOPS 网络内计算
第六代 NVLink 相比基于现成 Ethernet 的替代方案,为 GPU 到 GPU 传输提供更低延迟和更高包速率,同时具备集合操作的网络内计算能力
NVLink 交换机托盘和由 5,000 条线缆组成的 NVLink 脊柱形成单一全互联拓扑,任何 GPU 都能以一致的延迟和带宽与其他 GPU 通信。每个托盘包含四个 NVLink 6 交换芯片、28.8 TB/s 总托盘带宽和 14.4 TFLOPS FP8 网络内计算。在单个 Vera Rubin NVL72 机架中,NVLink 6 提供 260 TB/s 聚合带宽和 130 TFLOPS 网络内计算,用于加速规约和其他集合操作(如 all-reduce、reduce、broadcast 等)。
NVLink 技术路线图包括对高达 1152 GPU 扩容域的支持以及通过共封装光学的连接。

软件是扩容网络栈的关键组成部分,包括 NVIDIA Dynamo、NVIDIA TensorRT-LLM、NVIDIA Collective Communications Library (NCCL) 等(详见平台成熟度部分),全部构建于 NVIDIA CUDA 之上——这个世界领先的并行计算平台已发布近 20 年。
硬件和软件通过极致协同设计开发。这带来仅靠孤立栈元素无法实现的性能加速。对于当今 AI 工作负载,这直接转化为基础设施经济效益。
例如,从 NVIDIA Hopper 过渡到 NVIDIA Blackwell 时,NVLink 带宽翻倍、NVLink 扩容域从 8 GPU 扩展到 72 GPU,并引入 Dynamo 用于解耦式推理,NVIDIA 实现了 MoE 推理每瓦特性能 50 倍提升。
NVIDIA Vera Rubin 平台 通过将 NVLink 带宽和网络内计算再翻倍进一步扩展这一优势。

随着模型架构演进,硬件网络和软件通信栈同步演进。这种极致协同设计方法需要跨整个栈的紧密协作。尤其在超大规模部署压力下,孤立开发方法难以复制,但这正是简单添加加速器与扩展到有用交付性能之间的区别。
兼顾速度与智能韧性
AI 工厂必须持续运行。随着机架密度和价值提升,可维护性和故障管理成为性能方程的一部分。提供高带宽但需要破坏性维护的网络会降低有效容量和收入。
NVLink 6 引入专为 AI 工厂运维设计的管控和智能韧性特性。这些特性使机架维护更简便,提供更好的组件性能和负载均衡洞察,并在单个节点需要服务或更新时保持工厂运行。
第六代 NVLink 交换机支持智能韧性特性以最大化正常运行时间和有效产出:
- 控制平面韧性
- 支持部分填充机架运行
- 热插拔交换机托盘
- 带管理控制器回退的软件定义路由
- 动态流量重路由
- 在线软件更新
- 用于监控和故障归因的精细链路遥测
这些能力并非次要。在生产级 AI 工厂中,链路、交换机、托盘或管理控制器故障不应导致整个机架停机。运营商需要与基础设施经济价值相匹配的故障隔离、遥测和服务流程。NVLink 6 将扩容网络纳入与 AI 工厂栈其余部分相同的运维规范。
成熟技术与快速节奏
最强的技术策略兼具成熟度与速度。NVLink 两者兼备。
NVLink 现已进入第六代专为扩容网络打造的结构。它已大规模生产部署近十年,数百万 NVIDIA 芯片部署于支持 NVLink 的系统中,并拥有服务器、机架、线缆、交换机、软件和运维工具生态系统。
NVIDIA 年度平台节奏以 AI 创新速度交付新硬件能力,使行业能够快速部署新模型和工作流以满足全球 AI 需求。
除硬件外,NVIDIA 和社区还发布软件作为扩容网络栈的关键组件,包括:
- Dynamo:用于在多节点 GPU 环境中扩展生成式 AI 和推理模型的开源框架,支持解耦式服务、动态 GPU 分配、KV 缓存感知路由以及基于 NIXL 的数据移动。
- TensorRT-LLM:用于 NVIDIA GPU 上高性能 LLM 推理的开源 NVIDIA 库,使用优化内核、计算/通信重叠以及 NVFP4 和 FP8 等低精度格式提升吞吐量,包括 MoE 模型。
- NIXL:用于跨 GPU 内存、CPU 内存、NVMe 和远程存储快速数据传输的开源 NVIDIA 库,帮助在分布式系统中高效移动 KV 缓存和推理状态。
- NCCL:用于高速 GPU 通信的开源 NVIDIA 库,拥有十余年开源创新。包含拓扑感知集合操作、AI 框架集成以及用于网络内规约和其他集合操作的 SHARP 支持。
- 网络与内存管理:包含地址空间管理 API、可扩展内存语义以及内置内存一致性以实现高效 HBM 访问。
软件创新在硬件发布后持续进行,在产品生命周期内实现 X 倍加速。
NVLink-C2C 将网络扩展至 CPU
AI 工厂需要的不仅是 GPU 到 GPU 带宽。它们还需要高带宽、具备一致性的 CPU-GPU 连接,用于编排、数据移动、内存管理、存储服务以及混合计算阶段的代理工作负载。
NVIDIA NVLink-C2C 提供这一路径。在 Vera Rubin NVL72 平台中使用 Vera CPU 时,NVLink-C2C 在 CPU 和 GPU 之间提供 1.8 TB/s 一致性带宽,是 PCIe Gen6 的 7 倍。这实现 CPU 与 GPU 内存间的高速数据共享和统一一致性内存架构。对于基础设施团队,这意味着控制、内存和计算之间更少瓶颈。对于软件团队,它简化编程模型并支持 KV 缓存卸载、多模型执行、数据处理和代理编排等工作负载。
Vera 本身为此角色而设计,配备 88 个 NVIDIA 自定义 Olympus 核心、高内存带宽以及适用于 AI 工厂工作负载的低功耗运行。在 NVIDIA 平台中,CPU、GPU、NVLink、HBM、系统内存、网络和软件通过协同设计优化性能。
NVLink Fusion:无需从头开始的半定制 XPU 基础设施
超大规模运营商和 AI 原生企业为针对性工作负载和客户选项构建专用硅,但部署时面临多项挑战。集成最先进扩容网络、设计并部署完整机架级架构、在硅供应风险中承诺数据中心设计,以及支持异构基础设施均带来独特困难。
NVIDIA NVLink Fusion 提供这一路径。NVLink Fusion 是将定制硅连接至 NVIDIA 世界领先 AI 基础设施平台的高带宽、低延迟互连技术和 IP。借助 NVLink Fusion,他们可利用经验证的 NVLink 扩容栈和生态系统,降低开发和部署复杂度、提升性能,并加速半定制 AI 工厂的上市时间。通过标准化单一统一架构,NVLink Fusion 简化数据中心跨域运维、支持灵活重新配置数据中心容量,并使定制 AI XPU 能与 GPU 无缝集成用于解耦式计算。
这打破了基本约束,无需在定制 XPU 和世界级 AI 平台之间二选一。由于 NVLink Fusion 与 NVIDIA 技术路线图同步,采用者可跟上公司年度节奏。
生产级 AI 工厂之路
下一代 AI 工厂的胜出者不会是最快的独立加速器,而是能在最快节奏、以最低每令牌成本交付最多智能、且部署风险最低的基础设施。
NVLink 提供领先性能,具备 3 倍更低延迟、10 倍更高包速率以及 130 TFLOPS 网络内计算、工厂韧性特性以及成熟、经验证的平台。AI 工厂正在成为 AI 计算时代的基础设施。NVLink 提供驱动它们的性能、可运维性、成熟度以及持续创新。
了解更多关于 NVIDIA Vera Rubin 平台、NVLink 和 NVLink Fusion 的信息。
0 Comments
Log in to join the conversation.No comments yet. Be the first to share your thoughts.