时间:2026年10月3日
地点:美国
人物:CoreWeave团队、英伟达Ian Buck(超大规模与高性能计算VP)、Cognition联合创始人Silas Alberti
AI云服务商CoreWeave近日宣布,英伟达Vera Rubin NVL72系统已在CoreWeave Cloud正式投入生产,AI软件公司Cognition成为首个在该平台运行生产工作负载的客户。
核心数据:
4.8倍:Cognition在Vera Rubin NVL72上运行SWE-2推理任务,实测总Token吞吐量较GB200 NVL72提升高达4.8倍
3.8倍:强化学习场景中,每GPU输出Token吞吐量达到GB200 NVL72的3.8倍
10倍:DeepSeek-R1推理基准测试中,每兆瓦Token吞吐量达到GB200 NVL72的10倍
5分钟:无缆线模块化托盘设计将安装时间从两小时压缩至5分钟
11000+:单机架128颗Vera CPU、11264核,可支持超过11000个并发隔离环境
背景:
Vera Rubin NVL72系统由36颗Vera CPU和72颗Rubin GPU构成,采用100%全液冷设计。这是继今年6月CoreWeave首个完成系统验证后,正式进入生产阶段的里程碑。
Cognition通过Vera Rubin NVL72运行SWE-2推理任务(SWE-2是其最新一代自主AI软件工程师Devin的核心基准),验证了Rubin在真实智能体工作负载下的性能跃升。对于Devin这类需要反复读取大型代码库、长上下文推理、生成并执行代码、评估结果再迭代的编码智能体,4.8倍的Token吞吐意味着每个复杂工程任务的每个步骤都能更快完成。
Cognition联合创始人Silas Alberti表示:"智能体编码是复杂工作负载:长上下文、高并发、大Token量——每Token成本决定我们能交付什么。所有环节在同一平台、由英伟达和CoreWeave工程师共同解决,比任何单一参数更能说明问题。"
影响:
Vera Rubin NVL72进入生产意味着AI算力基础设施的代际升级正在从"跑分"走向"真实智能体工作负载"。4.8倍的Token吞吐跃升,直接转化为更快的实时代码生成和更灵敏的多步推理——这正是Devin等编码智能体,以及更广泛的AI Agent时代最需要的底层能力。
除GPU系统外,CoreWeave还将Vera CPU作为独立计算层提供,并同步推出Forge开发环境,整合Weights & Biases、OpenPipe等工具,覆盖实验追踪、模型评估与生产部署全流程。
英伟达超大规模与高性能计算副总裁Ian Buck指出,CoreWeave的V100 GPU至今仍在运行客户工作负载——这体现了英伟达平台跨代持续创造价值的长期能力。
总结:
CoreWeave正式将英伟达Vera Rubin NVL72推入生产,Cognition以Devin的SWE-2基准测试证明4.8倍Token吞吐跃升。对于需要长时间运行、高并发、长上下文的大模型推理与强化学习工作负载,Rubin NVL72已在真实生产环境中验证其代际性能优势,标志着AI算力基础设施从验证走向规模化商用的关键一步。
参考来源:
CoreWeave官方博客 - Cognition Becomes First Customer for NVIDIA Vera Rubin NVL72 on CoreWeave Cloud:https://www.coreweave.com/blog/cognition-becomes-first-customer-for-nvidia-vera-rubin-nvl72-on-coreweave-cloud
AI Industry Today - CoreWeave Vera Rubin NVL72投产:https://aiindustrytoday.com/news/coreweave-brings-nvidia-vera-rubin-nvl72-into-production-with-cognition-as-first-customer
AGI Hunt - Cognition 4.8x Token Throughput:https://agihunt.info/p/1a0f2f28e13a7757cd150d8113f?f=dr
新浪科技 - 英伟达新王炸投产:https://k.sina.com.cn/article_5953190046_162d6789e06703tlde.html







