返回信息流
新闻事件
A重点84
NVIDIA Developer Blog
1 个来源

NVIDIA Vera CPU:专为代理式AI设计的奥林巴斯核心,追求极致单线程性能

NVIDIA发布了Vera CPU,基于奥林巴斯核心,专为最大化单线程性能而设计,以应对代理式AI工作负载。该CPU旨在满足AI代理在沙盒环境中高效执行代码、调用工具和检索上下文的日益增长的需求。

SynthePulse Insight · AI 深度解读

NVIDIA Vera CPU:为智能体AI重塑单线程性能的奥林巴斯核心

版本 1 · 1 个来源

当AI工厂的执行重心从GPU转向CPU,NVIDIA推出了基于奥林巴斯核心的Vera CPU,专为智能体AI的复杂控制流和延迟敏感路径设计。本文从架构设计、多线程、内存子系统到安全互联,解析其如何最大化单线程性能。

  • Vera CPU的奥林巴斯核心专为智能体AI设计,强调单线程性能而非核心密度,以应对不规则控制流和长依赖链。
  • 前端采用10-wide解码引擎和神经分支预测器,提升分支密集型代码的指令吞吐。
  • 中核通过大重排序缓冲、物理寄存器堆和值预测,暴露隐藏的指令级并行。
  • 执行引擎平衡整数、向量、加密等资源,避免频率提升带来的瓶颈。
  • 缓存子系统针对指针密集和图形化工作负载优化,支持深度内存级并行。
  • 集成Spatial Multithreading、可扩展一致性结构(3.4 TB/s片内带宽)和SOCAMM2 LPDDR5X内存(1.2 TB/s聚合带宽)。
展开章节目录智能体AI的CPU设计新范式

智能体AI的CPU设计新范式

NVIDIA在官方技术博客中提出,智能体AI将更多关键执行路径转移到CPU上。代理在沙箱中执行代码、调用工具、检索上下文、与数据库交互,这些循环并发运行时,CPU性能决定了每个代理的响应速度和工厂整体吞吐量。

与传统云CPU追求核心密度和均匀负载吞吐量不同,智能体AI要求:强单线程性能(即使插槽满载)、每核足够的内存带宽、并发下可预测的延迟,以及高效处理不规则控制流、长依赖链和指针密集型数据结构。Vera CPU正是为此而生。

奥林巴斯核心架构:从前端到缓存的协同优化

奥林巴斯核心通过极致协同设计,在Vera Rubin平台层面整合CPU、GPU、网络、存储和软件。其前端配备10-wide解码引擎和神经分支预测器,后者针对困难、统计偏斜的分支模式提升准确性,每周期支持两个分支,减少错误路径执行。

中核通过宽重命名与分配引擎、大重排序缓冲和物理寄存器堆,实现深度乱序执行。依赖打破技术包括内存重命名、值预测和关键路径加速,减少指针代码和序列化内存操作导致的停顿。

执行引擎动态调度整数、分支、向量、浮点、加密、加载和存储资源,避免成为瓶颈。缓存子系统针对运行时对象、检索索引、图结构等不规则数据模式优化,传统预取设计在此类指针追逐场景中效果有限。

多线程与内存子系统:空间多线程与高带宽内存

Vera CPU集成NVIDIA Spatial Multithreading,允许灵活的资源分区,以支持并发代理工作负载。可扩展一致性结构提供3.4 TB/s片内带宽和统一缓存。

内存子系统采用SOCAMM2 LPDDR5X模块,提供高达1.2 TB/s聚合带宽,兼具高可靠性、可用性和可服务性(RAS)与能效。

安全可扩展的数据移动与互联

通过一致性NVLink-C2C、单NUMA双插槽架构、PCIe 6.4、CXL 3.1和机密计算,Vera CPU支持安全、可扩展的数据移动。这些特性确保可预测的代理工作负载吞吐量和跨AI工厂的安全VM隔离。

可信度边界

本文信息全部来自NVIDIA官方技术博客,属于第一方产品技术说明。所有架构细节和性能指标均为NVIDIA声称,未经独立第三方验证。

核心结论

NVIDIA Vera CPU通过奥林巴斯核心的深度乱序执行、神经分支预测、空间多线程和高带宽内存,为智能体AI提供了不同于传统云CPU的单线程性能优化方案,但其实际效果仍需在真实AI工厂环境中验证。

主报道

NVIDIA Developer Blog

主报道来源