Vera Rubin公布真实测试成绩:吞吐量最高飙升了30倍、Token成本最高暴降了35倍

浏览18次 点赞0次 收藏0次

AgentX工作负载下,搭配DeepSeek-V4-Pro1.6万亿参数)模型进行实测,Vera Rubin NVL72的每兆瓦吞吐量比上一代主力机皇GB300 NVL72最高提升了整整30倍。与此同时,生产每百万Token的成本最高降低了35倍。

这组数据是在NVIDIA Hot Chips 2026上,英伟达公布的一组Vera Rubin NVL72的真实测试数据。这一数据的震撼之处在于对比的参照系:GB300在同样的DeepSeek-V4-Pro测试中,每兆瓦吞吐量已经比H200提升了15倍。然而Vera Rubin在GB300的肩膀上,又拔高了30倍。

这意味着什么?对于受制于电力供应的AI工厂来说,这直接拓展了物理法则的边界——在同样的电力预算下,Vera Rubin能完成30倍的Agentic工作负载。对于兆瓦级甚至吉瓦级的数据中心而言,这相当于凭空变出了30倍的算力资产。

有业内人士感慨:“我连骗投资人的PPT都不敢这么写!”

极致协同设计:七款芯片与五种机架的系统级工程

Vera Rubin NVL72惊人的性能提升,并非靠单颗芯片的工艺突破,而是源于英伟达所谓的 “极致协同设计”(Extreme Co-Design) 。这一协同设计体现在多个层面:

一是计算与内存的协同:通过NVFP4量化技术,模型权重被压缩至4位精度,在不牺牲输出质量的前提下大幅减少了内存占用,为吞吐量提升铺平道路。同时,分布式KV缓存技术将内存扩展至整个GPU集群,并通过KV感知路由(KV-aware routing)将请求导向已缓存相关上下文的GPU,避免了昂贵的重复计算。

二是计算与计算的协同:Vera Rubin平台内部实现了Prefill(预填充)与Decode(解码)的分离式服务(Disaggregated Serving)。这两种操作对硬件的需求截然不同,分离后可以独立扩展,最大化效率。此外,针对DeepSeek等混合专家(MoE)模型,第六代NVLink提供高带宽、低延迟的纵向扩展互连,与基于通用以太网的替代解决方案相比,XPU到XPU传输的端到端延迟降低至三分之一,数据包速率提高10倍,确保72个GPU能行云流水地调用不同的“专家”网络。

三是软件与硬件的协同:NVIDIA Dynamo等推理优化引擎,通过融合CUDA内核(如MegaMoE),将大量计算与GPU间的通信操作合并为单次执行流程,确保GPU始终处于计算状态而非等待数据。同时,NVIDIA DSX MaxLPS技术能在工作负载层面进行精细化电源管理,在相同兆瓦预算内部署更多GPU,进一步提升能效。

整个Vera Rubin平台由七款专用芯片和五种专用机架构成。七款芯片包括:Rubin GPU、Vera CPU、NVLink 6 Switch、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6以太网交换器,以及Groq 3 LPU。五种机架系统则包括Vera Rubin NVL72、Vera CPU机架、Groq 3 LPX、Spectrum-6 SPX和Vera BlueField-4 STX。

这些组件被作为一个完整的系统进行工程研发,而非由通用产品简单拼凑而成。

英伟达认为,在Agentic AI时代,性能瓶颈早已不局限于单颗芯片的算力,而是横跨计算、网络、存储、供电、散热的系统性工程。

众所周知,在Agentic工作负载中,CPU承担着编排、工具调用、代码执行、数据处理和模拟等大量密集型任务。为此,英伟达打造出了Vera CPU这款专门为Agentic时代设计的高性能处理器,其定制Olympus核心相较竞品的芯粒方案,单线程性能提升2倍、核间带宽提升3倍、内存延迟降低40%。

在网络层面,第六代NVLink纵向扩展技术在处理复杂工作负载时,相比通用以太网吞吐量提升超过2倍、延迟降低至1/3、数据包处理速率提升10倍。这让像DeepSeek-V4-Pro这种基于MoE架构的大模型,可以在72个GPU之间行云流水地调用不同的“专家”子网络。

Spectrum-X Multiplane则解决了横向扩展的瓶颈。传统集群扩展到一定规模后需增加第三层网络,带来额外延迟、抖动及高昂成本。Multiplane将每台服务器的网络连接拆分为多条独立路径,构建扁平网络,可扩展至512,000个GPU,无需第三层交换。在八平面拓扑中,单平面失效仍可维持约90%的总带宽,硬件恢复速度比软件方案快11倍。

此外,NVIDIA Scale-In作为第五大网络支柱,由BlueField-4 DPU与DOCA软件平台驱动,将多租户网络、高性能存储访问、芯片级安全、弹性供应与实时可观测性等基础设施服务硬件加速,并与主机计算资源解耦。

Groq 3 LPX:破解解码延迟最后一公里

我们知道,Agentic AI带来了两个截然不同的计算挑战:一方面需要高效处理不断增长的大规模上下文,另一方面需要以极低延迟持续生成Token。传统架构中,计算密集型与访存密集型在同一资源池混跑,造成了结构性算力错配。

英伟达的解法是彻底分离:让Rubin GPU负责大规模上下文处理,把极速生成Token的任务交给Groq 3 LPX——一个管“读”,一个管“写”,各司其职。

在Hot Chips 2026大会上,英伟达宣布Groq 3 LPX全面量产。在一个完整的机架级部署中,多达256个LP30加速器通过超高带宽互连与GPU协同作战,构造出企业级规模的推理引擎。每个LPU加速器提供500MB的SRAM、150TB/s的SRAM带宽和2.5TB/s的纵向扩展带宽。

第三方机构的基准测试数据显示,在运行开源智能体模型Gemma 4 31B并处理10万Token的长上下文时,Groq 3 LPX实现了每秒3400个输出Token的创纪录速度,比最接近的替代平台快4倍。这一性能飞跃使得编码等智能体任务可以从数小时缩短至数分钟。这意味着,过去需要数小时才能完成的多步Agentic任务,现在几分钟内就能完成。

正如黄仁勋所言:“通过LPX推进超高速Token生成,在AI吞吐量和响应能力上实现了又一次巨大飞跃。”

总结:Agent生态的商业格局即将开始重写

Vera Rubin NVL72的发布标志着一个清晰的分水岭:LLM时代正在结束,Agent时代已经降临。旧有的AI跑分基准全部作废,行业需要全新的性能衡量标准——不是单次推理的速度,而是每兆瓦吞吐量和每Token成本。

英伟达通过Vera Rubin展示的不仅是一代更强大的硬件,而是一整套“AI工厂”的构建范式——从芯片到机架、从计算到网络、从Prefill到Decode,每一个层级都被极致协同设计所贯穿。这早已不是在卖显卡,而是在交付一整套面向Agentic AI时代的基础设施操作系统。

当推理成本呈断崖式下跌35倍时,24小时无休的数字员工将成为现实,ToC端的超级应用将迎来大爆发。Agent生态的商业格局,即将开始重写。

声明:本文转载自51CTO,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯