返回信息流
新闻事件
S信号87
DeepTech深科技
1 个来源

英伟达宣布AI专用CPU Vera全面量产,服务器CPU需求激增

英伟达宣布其首款为AI智能体打造的CPU Vera已全面量产,采用Arm指令集和自研Olympus核心,将进入Vera Rubin超级计算平台并单独销售。随着AI Agent任务形态变化,CPU在推理协调、安全检查和分词等环节的负担加重,市场对服务器CPU需求激增,Intel和AMD产能紧张。

SynthePulse Insight · AI 深度解读

GPU荒未平,CPU荒又起:AI智能体如何改写算力版图

版本 1 · 1 个来源

当AI从聊天机器人进化为智能体,CPU从幕后配角走向前台主角。英伟达、AMD、Arm、高通竞相布局“智能体CPU”,一场新的算力争夺战正在上演。

  • 英伟达2026年5月31日宣布88核Vera CPU全面量产,既用于Vera Rubin平台,也单独销售,戴尔、惠普、联想、超微等已开始制造搭载系统。
  • AMD测试显示,一条真实智能体流水线中8个阶段有7个完全运行在CPU上,智能体任务形态正将CPU从配角推向主角。
  • 佐治亚理工研究显示,长序列大批量下分词最高占首个Token延迟约80%,增加CPU核心可改善1.47-5.15倍,无需增加GPU。
  • KeyBanc 2026年1月调查称Intel大部分服务器CPU产能已售出,AMD接近满载;Intel财报印证服务器CPU需求超供应,价格同比涨27%,出货量降5%。
  • AMD将服务器CPU市场年增长预期从18%上调至35%以上,预计2030年市场规模超1200亿美元,理由是智能体需要独立CPU计算层。
  • Arm和高通分别推出136核AGI处理器和250核Dragonfly C1000,与Meta合作,智能体CPU竞争已跨越x86,扩展到Arm和自研核心。
展开章节目录智能体如何改变CPU的角色

智能体如何改变CPU的角色

过去三年,AI硬件焦虑几乎都围绕GPU展开,CPU只负责启动任务、搬运数据和管理服务器,很少成为主角。但AI Agent改变了任务形态:普通聊天机器人接收文字、运行模型、生成文字,而Agent还要读取文件、搜索网页、查询数据库、调用API、执行代码,一次任务可能经历十几轮“推理-操作-观察”,每一轮都在GPU与CPU之间切换。

GPU仍负责最重的模型计算,但解析模型输出、判断工具类型、发起请求、运行程序、管理文件、收集结果和安排下一轮任务等工作,通常由CPU处理。AMD计算与企业AI副总裁Madhu Rangarajan称,在公司测试的一条真实智能体流水线中,8个阶段有7个完全运行在CPU上。这个比例来自AMD自测,不一定代表所有系统,但足以说明模型推理只是智能体完成任务的一环,之外的所有协调工作都压在CPU上。

单个Agent的开销可能不大,但规模化后相当恐怖。企业部署给数万名员工后,并发任务迅速膨胀,每个智能体都在解析输出、执行代码和读写数据,CPU开销积累成容量需求。CPU处理得慢,GPU就要等待下一轮推理所需的输入。安全检查也增加负担:智能体权限越多,系统越需要检查文件、接口和敏感数据,规则匹配、日志分析和小模型审核通常留在CPU上,因为任务分散、延迟敏感,单独调用GPU未必划算。

分词:被忽视的CPU负担

另一个容易被忽视的负担是分词。大模型处理文本前要把文字转换成Token,这个过程包含大量字符串处理和条件分支,不像矩阵运算那样适合GPU。普通对话输入短,分词延迟没有存在感;智能体会不断积累工具返回结果、代码、日志和历史操作,输入可能增长到数万甚至数十万个Token。

佐治亚理工学院博士生Euijun Chung在接受IEEE Spectrum采访时举例称,在一些实现中,已有10万个Token的上下文再加入1,000个Token的工具结果,分词器仍可能重新处理整段输入。前缀缓存和增量分词可以减少重复工作,所以这并非所有系统必然采用的方式,但长文本带来的CPU压力仍然存在。

Chung团队在最新论文中测试了Llama 3.1和Qwen3等模型。在长序列、大批量配置下,分词最高占到首个Token延迟的约80%。当CPU核心数不足,分词线程还会与任务调度和GPU内核启动争抢资源,导致CPU满载、而GPU未能跑满。增加CPU核心后,不同配置的首个Token延迟改善了1.47-5.15倍,而无需增加GPU。

市场信号:服务器CPU供不应求

产业数据已经开始回应这一变化。2026年1月,KeyBanc根据供应链调查判断,Intel全年大部分服务器CPU产能已经售出,AMD的服务器CPU供应也接近满载,两家公司因此拥有了提价空间。这是分析机构的渠道判断,并非厂商披露的订单数据。

Intel随后的财务文件给出了部分印证。公司称,服务器CPU需求在2026年第一季度超过可供应数量,内部产能限制预计持续至年底。服务器产品平均售价同比提高27%,出货量却下降了5%;Intel将价格上涨归因于高端产品占比提升、需求定价和成本增加。

AMD同期的数据中心业务收入达到58亿美元,同比增长57%,增长同时来自EPYC服务器CPU和Instinct GPU。AMD没有单独披露服务器CPU收入增速,因此无法把这57%全部归因于智能体需求。公司对未来的判断更加激进:AMD此前预计服务器CPU市场年增长约18%;2026年5月又将预期提高到35%以上,预计市场规模到2030年超过1,200亿美元。

CPU-GPU比例变化与厂商布局

数据中心过去常用一颗CPU管理4-8颗GPU。AMD观察到,智能体系统正把这一比例推向1∶1,部分负载使用的CPU甚至更多。这仍是供应商根据客户需求作出的判断,工作负载不同,实际配置会有很大差异。比例变化的方向却很清楚:多配几颗CPU已经不够,云厂商开始考虑为智能体单独建设CPU机架。

Arm也在2026年3月第一次从出售处理器设计方案走向直接出售数据中心CPU。其AGI处理器最多拥有136个核心,由Meta参与开发。Arm预计,同等功耗下,智能体数据中心需要的CPU容量可能达到现有数据中心的4倍以上。高通随后发布拥有超过250个核心的Dragonfly C1000,并与Meta签署多代服务器CPU合作协议。

Intel、AMD、Arm、高通和英伟达在几个月内把“智能体CPU”写进各自的产品路线,说明这轮竞争已经越过传统的x86市场,扩展到Arm服务器、自研核心和整机架设计。英伟达在其中占据特殊位置:它既销售造成CPU压力的GPU,也销售缓解压力的Vera;从处理器、网络到存储,整套设备都可以由英伟达提供。Vera因而不只是一次产品线扩张,它还要保护GPU的利用率。

消费者可能为CPU荒买单

芯片厂商跟着钱走的时候,总有人要承担代价。和GPU、存储芯片一样,这次产能的变化很可能又是由消费者来买单。Intel在2025年第四季度财报电话会上承认,公司正在尽量把内部晶圆供应转向数据中心,同时增加客户端产品的外部代工;管理层随后补充说,Intel也不能完全退出客户端市场。

到了2026年第一季度,Intel客户端CPU的平均售价同比上涨16%,销量下降13%,公司预计供应限制至少持续至上半年。客户端产品的变化不能全部算在智能体头上,Intel自身的制程切换、内外部产能和内存供应同样影响了价格与出货。但在有限产能中,服务器芯片核心更多、售价更高,云厂商又愿意签订长期订单,生产资源自然也就开始向数据中心倾斜。

过去三年,普通消费者已经见识了GPU涨价和断货的滋味。接下来,同样的事可能发生在CPU上。

可信度边界

本文综合了英伟达官方公告、AMD高管博客、IEEE Spectrum报道、学术论文、KeyBanc渠道调查及Intel/AMD财报信息。其中,AMD的CPU占比、KeyBanc的产能判断、Arm的容量预测等均来自供应商或分析机构的自述,未经独立验证,标注为来源声称。Intel和AMD的财务数据来自公司财报,属于确认事实。

核心结论

AI智能体的兴起正在重塑算力需求结构,CPU从配角变为关键瓶颈。英伟达、AMD、Arm、高通等厂商竞相布局,服务器CPU供不应求,价格与出货量出现背离。这场变革可能最终由消费者通过CPU涨价买单。

主报道

DeepTech深科技

主报道来源