1. 首页 > 热门有趣手游

NVIDIA公开Rubin GPU架构细节:面给Agentic AI从头设计GPU nvidia gop

作者:admin 更新时间:2026-07-22
摘要:NVIDIA发布最新官方技术博客,首次系统披露Rubin GPU架构设计。相较此前公布的产品规格,此次重点介绍了Rubin面向Agentic AI的架构优化,包括Tensor Memory Accelerator、第三代Transformer Engine、自适应压缩等核心技术,进一步揭示下一代AI Factory的设计方向。

,NVIDIA公开Rubin GPU架构细节:面给Agentic AI从头设计GPU nvidia gop

 

NVIDIA发布最新官方技术博客,首次系统披露Rubin GPU架构设计。相较此前公布的产品规格,此次重点介绍了Rubin面向Agentic AI的架构优化,包括Tensor Memory Accelerator、第三代Transformer Engine、自适应压缩等核心技术,进一步揭示下一代AI Factory的设计方向。

PChome 2026年7月22日消息】北京时间7月22日,NVIDIA连续发布两篇官方技术博客,首次深入公开下一代Rubin GPU的架构设计细节。相比今年CES和GTC公布的产品规格,此次官方披露的重点不再是FP4算力、HBM4等基础参数,而是首次解释Rubin GPU为何围绕Agentic AI(智能体AI)重新设计,并详细介绍了第三代Transformer Engine、Tensor Memory Accelerator(TMA)以及Adaptive Compression(自适应压缩)等关键技术,揭示了NVIDIA下一代AI基础设施的底层思路。

与生成式AI时代主要依赖大规模训练不同,NVIDIA认为,未来AI计算将逐渐转向以推理、规划、多Agent协作和工具调用为代表的Agentic AI阶段。这类工作负载拥有更长上下文、更频繁的数据交换以及更多CPU与GPU协同需求,因此GPU架构的优化目标也从单纯提升峰值算力,转向提高整体系统吞吐率、能效以及每Token成本。 

为此,Rubin GPU在多个关键模块进行了重新设计。其中,Tensor Memory Accelerator(TMA)获得进一步增强,能够降低专家模型(MoE)等复杂AI负载中的数据搬运开销,并通过更灵活的描述符管理减少GPU等待数据的时间,使计算单元保持更高利用率。NVIDIA表示,这一优化旨在解决当前大模型推理过程中计算速度越来越快、数据供给却逐渐成为瓶颈的问题。

另一项重要升级来自第三代Transformer Engine。官方介绍,新一代引擎加入了Adaptive Compression(自适应压缩)能力,可针对KV Cache等推理数据进行动态压缩,在尽量保持模型精度的前提下显著降低HBM带宽占用,从而缓解长上下文推理带来的内存压力。这意味着Rubin不仅依靠HBM4更高的物理带宽提升性能,也通过软硬件协同进一步提高显存利用效率。

从产品规格来看,Rubin平台延续了此前公布的信息,包括单颗GPU最高可提供50 PFLOPS(NVFP4) AI算力,采用HBM4高带宽显存,并与Vera CPU组成新一代Vera Rubin平台。在整机层面,Vera Rubin NVL72由72块Rubin GPU和36颗Vera CPU组成,针对大规模AI推理和后训练(Post-training)进行了优化。

值得关注的是,NVIDIA此次还首次披露了更多来自产业合作伙伴的部署情况。官方表示,目前已有CoreWeave、Google Cloud、Microsoft Azure、Mistral AI等合作伙伴基于Vera Rubin平台开展测试与部署。NVIDIA强调,新平台的目标不仅是提升峰值性能,更重要的是降低Performance per Watt(每瓦性能成本)以及Token Cost(每Token生成成本),帮助AI工厂获得更高的整体运行效率。

从行业发展来看,此次官方博客释放出的信号十分明确。随着AI产业逐渐进入以推理为主的新阶段,GPU竞争已不再局限于算力数字,而是扩展至CPU协同、内存系统、互连网络、软件栈乃至整机架构。Rubin GPU的公开,也意味着NVIDIA正试图重新定义AI基础设施的设计标准,将GPU从单一计算芯片进一步演进为AI Factory的核心计算节点。