人工智能由 token 驱动。每一次提示、每一步推理以及每一次智能体交互都会生成 token。过去一年里,token 消耗量成倍增长,如今每年已超过 10 quadrillion 个 token。而且,虽然目前大多数 token 仍来自人类与 AI 的交互,但新的时代将是大多数 token 由 AI 与 AI 的交互生成。
现代 Agentic 系统会规划任务、调用工具、执行代码、检索数据,并在由众多 AI 智能体参与的连续多步骤工作流中进行协同。这些交互会产生大量推理 token,扩展 KV cache,并需要基于 CPU 的沙箱环境来测试和验证加速计算系统生成的结果。这对 GPU、CPU、纵向扩展域、横向扩展网络以及存储都提出了低时延、高吞吐的要求。
要为这类现代 Agentic 系统提供有用的智能能力,需要由专门打造的机架级系统组成的集群,并让它们像一台统一的 AI 超级计算机那样协同运行。本文介绍 NVIDIA Vera Rubin POD,这是一组基于第三代 NVIDIA MGX 机架架构、面向 Agentic AI 时代打造的五种专用机架级系统。
介绍 NVIDIA Vera Rubin POD
NVIDIA Vera Rubin 通过覆盖计算、网络和存储的七款芯片进行深度协同设计,构建出目前最复杂的 POD 级 AI 平台。该平台包括 40 个机架、1.2 quadrillion 个晶体管、近 20,000 颗 NVIDIA die、1,152 个 NVIDIA Rubin GPU、60 exaflops,以及总计 10 PB/s 的纵向扩展带宽。
Vera Rubin POD 引入了五种全新的、彼此不同的专用机架级系统,用于需要高吞吐、超低时延推理、高密度 CPU 沙箱以及大规模上下文内存存储的 Agentic AI 工作负载。这些机架共同组成一个统一系统,将为全球能效和成本效率最高的数据中心提供支撑。
POD 中的每一款芯片都可随第三代 NVIDIA MGX 机架扩展,背后有一个由 80 多家合作伙伴组成的生态体系,以及一个在大规模 AI 系统商业化方面经验丰富的全球供应链。这使得部署更快速、过渡更平滑,同时每个 NVIDIA MGX 机架共享相同的供电、散热和机械规格边界。
MGX 机架有两种类型,均采用铜制 spine,旨在兼顾性能、韧性和能效。MGX NVL 机架通过 NVIDIA NVLink 连接,而新的 NVIDIA MGX ETL 机架则通过两种 spine 之一连接:NVIDIA Spectrum-X Ethernet,或 NVIDIA Groq 3 LPU 直连芯片到芯片链路。
NVIDIA Vera Rubin NVL72:面向四个扩展定律的平台
NVIDIA Vera Rubin NVL72 是新一代 AI 工厂的核心机架级计算引擎。它集成了 72 个 NVIDIA Rubin GPU 和 36 个 NVIDIA Vera CPU,并通过大规模 NVLink 铜制 spine 连接,整体上相当于一个巨型 GPU。NVIDIA Vera Rubin NVL72 面向 AI 的四个扩展定律而设计:预训练、后训练、测试时扩展和 Agentic 扩展。它可以针对复杂的专家混合(MoE)路由,以及 AI 推理中计算密集型的上下文阶段进行优化。与 NVIDIA Blackwell 相比,它可实现最高 4 倍的训练性能、最高 10 倍的每瓦推理性能,以及十分之一的 token 成本。
NVIDIA Groq 3 LPX:推理加速机架
NVIDIA Groq 3 LPX 针对 Agentic AI 对大规模上下文和低时延的需求,与 NVIDIA Vera Rubin 平台协同设计,每个机架配备 256 个 language processing unit(LPU)。它与 Vera Rubin NVL72 搭配使用,以消除高速交互性与吞吐量之间的权衡。通过将仅采用高带宽 SRAM 的 LPU 与具备大容量 HBM 的 Rubin GPU 结合,这套系统能在长上下文长度下同时提供低时延和高吞吐,在不牺牲系统吞吐量的前提下,显著提升万亿参数模型的用户交互体验。与 Blackwell 相比,Vera Rubin NVL72 加上 LPX 可带来最高 35 倍的 token 产出,以及最高 10 倍的万亿参数模型收入机会。更多内容可参见 Inside NVIDIA Groq 3 LPX。
NVIDIA Vera CPU 机架:面向大规模 Agentic AI 和强化学习
NVIDIA Vera CPU 机架在高密度液冷机架中集成了最多 256 个 NVIDIA Vera CPU,以提供可扩展且节能的算力容量。单个机架可持续支持超过 22,500 个并发强化学习(RL)或智能体沙箱环境,从而最大化用于测试、执行和验证 Vera Rubin NVL72 与 LPX 机架结果的环境数量。Vera CPU 机架为大规模 Agentic AI 和强化学习提供基础,其结果交付效率是传统机架级 CPU 的两倍,速度快 50%。如需了解更多,可参阅 Vera CPU 如何为 AI 工厂提供高性能带宽和效率。



