当前位置: 首页 » 资讯 » 新科技 » 正文

英伟达Vera Rubin首秀,DeepSeek V4 Pro 跑出30倍Agent吞吐

IP属地 中国·北京 机器之心Pro 时间:2026-08-25 14:37:44

机器之心编辑部


过去几年,AI 基础设施的竞争核心是 GPU。更大的模型、更高的参数规模、更强的推理能力,都推动着数据中心不断堆叠 GPU。

但随着 AI Agent 开始执行越来越复杂的任务,新的计算需求出现。一个 Agent 不再只是完成一次模型推理,它需要持续规划任务、调用工具、执行代码、处理数据,并在多个步骤之间保持上下文。

根据 NVIDIA 引用的 OpenRouter 数据,真实 AI 流量中平均 prompt 长度已增长约 4 倍,单次 Agentic 请求消耗的 token 数量最高可达普通聊天请求的 15 倍。这意味着,AI 系统需要的不只是更强的模型,也需要一套专门支撑 Agent 运行的计算架构。

就在今天早上,NVIDIA 首次公布了基于真实芯片的 Vera Rubin 性能测试结果。

在针对 Agent 工作负载的测试中,Vera Rubin 相比上一代 GB300 NVL72 最高实现每兆瓦吞吐提升 30 倍,并将 token 成本最高降低 35 倍。



就在同一时间,SpaceXAI 宣布将部署 NVIDIA Vera CPU,并计划基于 Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,进一步探索将优化后的 Vera Rubin NVL72 系统部署到轨道计算环境。



从 Agent 性能测试,到 SpaceX 的轨道计算探索,NVIDIA 展示了一个新的方向:未来 AI 竞争的关键,不只是模型能力,还有支撑 Agent 持续行动的计算基础设施。

Vera Rubin 首次面向 Agent 工作负载测试

过去的大模型性能测试,更多关注固定输入长度下的推理速度。但 AI Agent 改变了这一标准。衡量 Agent 基础设施能力,不能再依赖传统的固定 prompt 测试,而需要接近真实生产环境的工作负载。这也是 NVIDIA 此次测试的重点。

NVIDIA 采用SemiAnalysis 的 AgentX 工作负载,对 Vera Rubin NVL72 的 Agent 性能进行评估。AgentX 是一个面向 Agentic Coding Inference(智能体代码推理)的基准测试,通过回放真实生产风格的 Agent 会话,评估计算系统处理真实 Agent 请求的能力。



智能体(Agent)会话会产生动态变化的推理序列。

与传统聊天任务不同,Agent 会话具有明显的长链路特征:一次任务中可能包含连续的模型调用、工具使用以及不断累积的上下文。AgentX 会保留原始任务中的上下文长度、输入输出序列、推理时间以及工具调用延迟,以模拟真实 Agent 运行状态。

例如,一个代码 Agent 完成开发任务时,可能需要理解需求、分析代码库、修改程序、执行测试,并根据测试结果继续调整方案。随着任务推进,系统不仅需要处理更长的上下文,还需要持续复用此前已经处理的信息。

NVIDIA 展示的一条真实 Agent 轨迹中,主 Agent 的上下文可以从约 6 万 token 一路增长到接近 40 万 token,同时穿插多个子 Agent 请求。也就是说,对 Agent 而言,「长上下文」是在任务推进过程中自然形成的运行状态,而非偶尔出现的极端情况。



NVIDIA 将这样的指标定义为 AI 工厂级的「每兆瓦吞吐量」(tokens per megawatt)。AgentX 同时关注吞吐效率、端到端延迟、首 token 时间等指标,以衡量系统是否能够在高效率下保持良好的交互体验。

在测试中,NVIDIA 使用 DeepSeek V4 Pro 模型运行 AgentX 工作负载。结果显示,在每位用户 160 tokens/s 交互目标下,Vera Rubin NVL72 相比 GB300 NVL72 最高实现 30 倍更高的 AI 工厂级每兆瓦吞吐量,意味着在相同能源预算下,可以支撑更多 Agent 推理任务。



NVIDIA 将 Vera 定义为「首款为 AI Agent 打造的 CPU」。它采用 88 个 NVIDIA 设计的 Olympus 核心,并搭载高带宽 LPDDR5X 内存,最高提供 1.2TB/s 内存带宽。

当然,Vera 并不是要替代 GPU,它在 AI 系统中承担新的角色:GPU 继续负责大规模模型计算,Vera 则负责支撑 Agent 运行过程中的任务调度、代码执行和数据处理。

30 倍从哪里来?

如果只把 30 倍归因于 Rubin GPU 本身,就会低估 Vera Rubin 真正发生的变化。NVIDIA 此次展示的性能,本质上是一项 rack-scale system result,而不是单颗 chip result。



Agent 运行到后期,会不断处理越来越长的上下文。推理系统不仅需要执行 Transformer 计算,还必须高效保存和复用 KV Cache,并在不同 GPU 之间交换模型专家、上下文状态和中间结果。随着上下文长度、用户交互速度和并发规模不断提高,瓶颈也开始从单纯的 GPU 算力扩展到内存、通信、缓存管理和系统调度。

为此,Vera Rubin NVL72 将 Rubin GPU、HBM4、NVlink 6 以及新的推理软件栈放在一起进行协同设计。Rubin 单 GPU 配置 288 GB HBM4,内存带宽达到 22 TB/s;NVlink 6 则为单 GPU 提供 3.6 TB/s scale-up 双向带宽。对于 72 颗 GPU 组成的 NVL72 而言,更大的统一 scale-up domain 能够让 MoE 专家并行、分布式 KV Cache 等机制在整个机架内运行。

软件层面的变化同样重要。NVIDIA 列出的关键机制包括 Prefill/Decode 分离、Distributed KV Cache、KV Cache offloading、KV-aware routing 以及大规模 Expert Parallelism。

以 KV-aware routing 为例,当一个 Agent 再次发起请求时,系统可以尽量将任务路由到已经保存对应上下文缓存的 GPU,从而避免重新计算此前处理过的大量 token。对于上下文可能持续增长到几十万 token 的 Agent 而言,这种缓存复用会直接影响吞吐、延迟以及每个 token 的实际成本。

换句话说,Rubin 真正升级的并不只是一颗 GPU,而是一条完整的「token 生产流水线」:从读取长上下文、执行模型,到交换 KV Cache 和 MoE 专家,再到持续生成 token,每一层都会共同决定最终能够服务多少 Agent。

而 NVIDIA 还在进一步拆分这条 token 生产流水线。

就在公布 Vera Rubin Agent 性能测试的同一天,NVIDIA 宣布 Groq 3 LPX 进入全面量产,并将其纳入 Vera Rubin 平台。Groq 3 LPX 被定位为面向交互式 AI 的低延迟推理加速器,它并不是替代 Rubin GPU,而是针对 Agent 推理中另一类计算特征进行专门优化。

大模型推理通常可以粗略分成两个阶段:首先是 Prefill,即读取和处理 prompt 以及已经积累的大量上下文;随后是 Decode,即模型一个接一个地生成新的 token。

对于拥有几十万 token 上下文的 Agent 而言,这两个阶段对硬件的要求并不相同。Prefill 需要较高的计算能力和内存吞吐,而 Decode 则更加关注单 token 生成延迟和用户能够实际获得的 tokens/s。



因此,NVIDIA 正在开始把不同类型的 Agent 计算分配给不同处理器:Vera CPU 负责模型之外的任务编排、代码执行和数据处理;Rubin GPU 承担大规模模型计算、长上下文以及高吞吐推理;Groq 3 LPX 则进一步针对高交互、低延迟 token 生成进行优化。

第三方机构 Artificial Analysis 在 Gemma 4 31B 模型、100K 上下文测试中,测得 Groq 3 LPX 达到 3431 output tokens/s;NVIDIA 自己的 SPEED-Bench 测试中,其编码任务中位生成速度达到 4767 output tokens/s。

更重要的是,Groq 3 LPX 可以直接与 Vera Rubin NVL72 组合运行。一种方案是让 Rubin 负责 Prefill,再将 Decode 交给 Groq 3 LPX;也可以进一步拆分 Attention 和 FFN 计算,或者让 LPX 承担 speculative decoding 中的 draft model。



这意味着,Agent 背后的计算系统可能不会再由一种通用处理器承担全部工作,而会越来越接近一座异构计算工厂:不同芯片处理最适合自己的计算阶段,再由高速互联、缓存和软件系统把它们组合成一条完整的 token 生产线。



事实上,NVIDIA 目前的 Vera Rubin 平台已经扩展为一个包含多类芯片的系统,包括 Vera CPU、Rubin GPU、Groq 3 LPU、NVlink 6 Switch、BlueField-4 DPU、ConnectX-9 SuperNIC 以及 Spectrum-6 Ethernet。

GPU 仍然位于整个系统的核心位置,但它已经不再独立承担 AI 基础设施的全部竞争任务。

SpaceX 加入:从 AI 工厂走向轨道计算

Vera Rubin 的另一项重要应用来自 SpaceXAI。

NVIDIA 宣布,SpaceXAI 将部署 Vera CPU,用于加速下一代 Agentic AI 应用,包括任务编排、代码执行和数据处理。同时,SpaceXAI 计划基于 NVIDIA Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,并计划随着计算基础设施继续扩张,向吉瓦级计算容量发展。

据马斯克透露,SpaceX 与 NVIDIA 已经设计了一套针对太空环境优化的 Vera Rubin NVL72 系统,计划于明年第四季度发射进入轨道,并在 2028 年实现更大规模部署。



不过,轨道计算并不是简单把地面服务器搬到太空。太空环境对于计算系统提出了完全不同的要求:有限能源、更复杂散热条件、更高可靠性要求,以及长期无人维护能力。

因此,SpaceX 和 NVIDIA 正在探索如何将 Vera Rubin 架构适配到轨道环境,同时保持统一的软件生态。

AI 基础设施竞争进入 Agent 时代

过去,AI 产业竞争围绕模型展开。谁拥有更强的大模型,谁就拥有优势。但 Agent 时代改变了竞争规则。

当 AI 开始执行长链路任务,计算系统需要同时解决性能、成本、能源效率和任务调度问题。

Vera Rubin 代表的是 NVIDIA 对下一阶段 AI 基础设施的判断:未来的 AI 工厂,不只是训练模型的地方,也将成为大量 Agent 持续运行的计算平台。

而 SpaceX 探索的轨道计算,则进一步拓展了这种架构的边界。从地面 AI 工厂,到未来可能出现的轨道计算节点,AI 基础设施进入到了一个新的阶段。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

全站最新