Nvidia Vera Rubin NVL72 在推理性能和 TCO 方面较 Blackwell 取得巨大提升
SemiAnalysis 发布了一份架构和总拥有成本分析报告,比较了 Nvidia 的 Vera Rubin NVL72 与 GB200 NVL72。来自 CoreWeave 的早期工程数据表明,运行 DeepSeek R1 的 Vera Rubin NVL72 与当前的 GB200 NVL72 系统相比,每兆瓦的性能提升了 5.4 倍,每美元的性能提升了 5 倍。此外,Nvidia 推出了首个带有 CUDA 13.4 的公开 Rubin 软件栈,向 PyTorch、vLLM 和 OpenAI Triton 提交了上游拉取请求,以允许重用 Blackwell 内核。Rubin 还得益于更简单、无电缆的计算托架设计,以加快其生产提升速度。