机器之心编辑部
过去几年,AI 基础设施的竞争核心是 GPU。更大的模型、更高的参数规模、更强的推理能力,都推动着数据中心不断堆叠 GPU。
但随着 AI Agent 开始执行越来越复杂的任务,新的计算需求出现。一个 Agent 不再只是完成一次模型推理,它需要持续规划任务、调用工具、执行代码、处理数据,并在多个步骤之间保持上下文。
根据 NVIDIA 引用的 OpenRouter 数据,真实 AI 流量中平均 prompt 长度已增长约 4 倍,单次 Agentic 请求消耗的 token 数量最高可达普通聊天请求的 15 倍。这意味着,AI 系统需要的不只是更强的模型,也需要一套专门支撑 Agent 运行的计算架构。
就在今天早上,NVIDIA 首次公布了基于真实芯片的 Vera Rubin 性能测试结果。
在针对 Agent 工作负载的测试中,Vera Rubin 相比上一代 GB300 NVL72 最高实现每兆瓦吞吐提升 30 倍,并将 token 成本最高降低 35 倍。
![]()
就在同一时间,SpaceXAI 宣布将部署 NVIDIA Vera CPU,并计划基于 Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,进一步探索将优化后的 Vera Rubin NVL72 系统部署到轨道计算环境。
![]()
从 Agent 性能测试,到 SpaceX 的轨道计算探索,NVIDIA 展示了一个新的方向:未来 AI 竞争的关键,不只是模型能力,还有支撑 Agent 持续行动的计算基础设施。
Vera Rubin 首次面向 Agent 工作负载测试
过去的大模型性能测试,更多关注固定输入长度下的推理速度。但 AI Agent 改变了这一标准。衡量 Agent 基础设施能力,不能再依赖传统的固定 prompt 测试,而需要接近真实生产环境的工作负载。这也是 NVIDIA 此次测试的重点。
NVIDIA 采用SemiAnalysis 的 AgentX 工作负载,对 Vera Rubin NVL72 的 Agent 性能进行评估。AgentX 是一个面向 Agentic Coding Inference(智能体代码推理)的基准测试,通过回放真实生产风格的 Agent 会话,评估计算系统处理真实 Agent 请求的能力。
![]()
智能体(Agent)会话会产生动态变化的推理序列。
与传统聊天任务不同,Agent 会话具有明显的长链路特征:一次任务中可能包含连续的模型调用、工具使用以及不断累积的上下文。AgentX 会保留原始任务中的上下文长度、输入输出序列、推理时间以及工具调用延迟,以模拟真实 Agent 运行状态。
例如,一个代码 Agent 完成开发任务时,可能需要理解需求、分析代码库、修改程序、执行测试,并根据测试结果继续调整方案。随着任务推进,系统不仅需要处理更长的上下文,还需要持续复用此前已经处理的信息。
NVIDIA 展示的一条真实 Agent 轨迹中,主 Agent 的上下文可以从约 6 万 token 一路增长到接近 40 万 token,同时穿插多个子 Agent 请求。也就是说,对 Agent 而言,「长上下文」是在任务推进过程中自然形成的运行状态,而非偶尔出现的极端情况。
![]()
NVIDIA 将这样的指标定义为 AI 工厂级的「每兆瓦吞吐量」(tokens per megawatt)。AgentX 同时关注吞吐效率、端到端延迟、首 token 时间等指标,以衡量系统是否能够在高效率下保持良好的交互体验。
在测试中,NVIDIA 使用 DeepSeek V4 Pro 模型运行 AgentX 工作负载。结果显示,在每位用户 160 tokens/s 交互目标下,Vera Rubin NVL72 相比 GB300 NVL72 最高实现 30 倍更高的 AI 工厂级每兆瓦吞吐量,意味着在相同能源预算下,可以支撑更多 Agent 推理任务。
![]()
NVIDIA 将 Vera 定义为「首款为 AI Agent 打造的 CPU」。它采用 88 个 NVIDIA 设计的 Olympus 核心,并搭载高带宽 LPDDR5X 内存,最高提供 1.2TB/s 内存带宽。
当然,Vera 并不是要替代 GPU,它在 AI 系统中承担新的角色:GPU 继续负责大规模模型计算,Vera 则负责支撑 Agent 运行过程中的任务调度、代码执行和数据处理。
30 倍从哪里来?
如果只把 30 倍归因于 Rubin GPU 本身,就会低估 Vera Rubin 真正发生的变化。NVIDIA 此次展示的性能,本质上是一项 rack-scale system result,而不是单颗 chip result。
![]()
Agent 运行到后期,会不断处理越来越长的上下文。推理系统不仅需要执行 Transformer 计算,还必须高效保存和复用 KV Cache,并在不同 GPU 之间交换模型专家、上下文状态和中间结果。随着上下文长度、用户交互速度和并发规模不断提高,瓶颈也开始从单纯的 GPU 算力扩展到内存、通信、缓存管理和系统调度。
为此,Vera Rubin NVL72 将 Rubin GPU、HBM4、NVlink 6 以及新的推理软件栈放在一起进行协同设计。Rubin 单 GPU 配置 288 GB HBM4,内存带宽达到 22 TB/s;NVlink 6 则为单 GPU 提供 3.6 TB/s scale-up 双向带宽。对于 72 颗 GPU 组成的 NVL72 而言,更大的统一 scale-up domain 能够让 MoE 专家并行、分布式 KV Cache 等机制在整个机架内运行。
软件层面的变化同样重要。NVIDIA 列出的关键机制包括 Prefill/Decode 分离、Distributed KV Cache、KV Cache offloading、KV-aware routing 以及大规模 Expert Parallelism。
以 KV-aware routing 为例,当一个 Agent 再次发起请求时,系统可以尽量将任务路由到已经保存对应上下文缓存的 GPU,从而避免重新计算此前处理过的大量 token。对于上下文可能持续增长到几十万 token 的 Agent 而言,这种缓存复用会直接影响吞吐、延迟以及每个 token 的实际成本。
换句话说,Rubin 真正升级的并不只是一颗 GPU,而是一条完整的「token 生产流水线」:从读取长上下文、执行模型,到交换 KV Cache 和 MoE 专家,再到持续生成 token,每一层都会共同决定最终能够服务多少 Agent。
而 NVIDIA 还在进一步拆分这条 token 生产流水线。
就在公布 Vera Rubin Agent 性能测试的同一天,NVIDIA 宣布 Groq 3 LPX 进入全面量产,并将其纳入 Vera Rubin 平台。Groq 3 LPX 被定位为面向交互式 AI 的低延迟推理加速器,它并不是替代 Rubin GPU,而是针对 Agent 推理中另一类计算特征进行专门优化。
大模型推理通常可以粗略分成两个阶段:首先是 Prefill,即读取和处理 prompt 以及已经积累的大量上下文;随后是 Decode,即模型一个接一个地生成新的 token。
对于拥有几十万 token 上下文的 Agent 而言,这两个阶段对硬件的要求并不相同。Prefill 需要较高的计算能力和内存吞吐,而 Decode 则更加关注单 token 生成延迟和用户能够实际获得的 tokens/s。
![]()
因此,NVIDIA 正在开始把不同类型的 Agent 计算分配给不同处理器:Vera CPU 负责模型之外的任务编排、代码执行和数据处理;Rubin GPU 承担大规模模型计算、长上下文以及高吞吐推理;Groq 3 LPX 则进一步针对高交互、低延迟 token 生成进行优化。
第三方机构 Artificial Analysis 在 Gemma 4 31B 模型、100K 上下文测试中,测得 Groq 3 LPX 达到 3431 output tokens/s;NVIDIA 自己的 SPEED-Bench 测试中,其编码任务中位生成速度达到 4767 output tokens/s。
更重要的是,Groq 3 LPX 可以直接与 Vera Rubin NVL72 组合运行。一种方案是让 Rubin 负责 Prefill,再将 Decode 交给 Groq 3 LPX;也可以进一步拆分 Attention 和 FFN 计算,或者让 LPX 承担 speculative decoding 中的 draft model。
![]()
这意味着,Agent 背后的计算系统可能不会再由一种通用处理器承担全部工作,而会越来越接近一座异构计算工厂:不同芯片处理最适合自己的计算阶段,再由高速互联、缓存和软件系统把它们组合成一条完整的 token 生产线。
![]()
事实上,NVIDIA 目前的 Vera Rubin 平台已经扩展为一个包含多类芯片的系统,包括 Vera CPU、Rubin GPU、Groq 3 LPU、NVlink 6 Switch、BlueField-4 DPU、ConnectX-9 SuperNIC 以及 Spectrum-6 Ethernet。
GPU 仍然位于整个系统的核心位置,但它已经不再独立承担 AI 基础设施的全部竞争任务。
SpaceX 加入:从 AI 工厂走向轨道计算
Vera Rubin 的另一项重要应用来自 SpaceXAI。
NVIDIA 宣布,SpaceXAI 将部署 Vera CPU,用于加速下一代 Agentic AI 应用,包括任务编排、代码执行和数据处理。同时,SpaceXAI 计划基于 NVIDIA Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,并计划随着计算基础设施继续扩张,向吉瓦级计算容量发展。
据马斯克透露,SpaceX 与 NVIDIA 已经设计了一套针对太空环境优化的 Vera Rubin NVL72 系统,计划于明年第四季度发射进入轨道,并在 2028 年实现更大规模部署。
![]()
不过,轨道计算并不是简单把地面服务器搬到太空。太空环境对于计算系统提出了完全不同的要求:有限能源、更复杂散热条件、更高可靠性要求,以及长期无人维护能力。
因此,SpaceX 和 NVIDIA 正在探索如何将 Vera Rubin 架构适配到轨道环境,同时保持统一的软件生态。
AI 基础设施竞争进入 Agent 时代
过去,AI 产业竞争围绕模型展开。谁拥有更强的大模型,谁就拥有优势。但 Agent 时代改变了竞争规则。
当 AI 开始执行长链路任务,计算系统需要同时解决性能、成本、能源效率和任务调度问题。
Vera Rubin 代表的是 NVIDIA 对下一阶段 AI 基础设施的判断:未来的 AI 工厂,不只是训练模型的地方,也将成为大量 Agent 持续运行的计算平台。
而 SpaceX 探索的轨道计算,则进一步拓展了这种架构的边界。从地面 AI 工厂,到未来可能出现的轨道计算节点,AI 基础设施进入到了一个新的阶段。





京公网安备 11011402013531号