英伟达宣布AI专用CPU Vera全面量产,服务器CPU需求激增
英伟达宣布其首款为AI智能体打造的CPU Vera已全面量产,采用Arm指令集和自研Olympus核心,将进入Vera Rubin超级计算平台并单独销售。随着AI Agent任务形态变化,CPU在推理协调、安全检查和分词等环节的负担加重,市场对服务器CPU需求激增,Intel和AMD产能紧张。
英伟达宣布其首款为AI智能体打造的CPU Vera已全面量产,采用Arm指令集和自研Olympus核心,将进入Vera Rubin超级计算平台并单独销售。随着AI Agent任务形态变化,CPU在推理协调、安全检查和分词等环节的负担加重,市场对服务器CPU需求激增,Intel和AMD产能紧张。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
当AI从聊天机器人进化为智能体,CPU从幕后配角走向前台主角。英伟达、AMD、Arm、高通竞相布局“智能体CPU”,一场新的算力争夺战正在上演。
过去三年,AI硬件焦虑几乎都围绕GPU展开,CPU只负责启动任务、搬运数据和管理服务器,很少成为主角。但AI Agent改变了任务形态:普通聊天机器人接收文字、运行模型、生成文字,而Agent还要读取文件、搜索网页、查询数据库、调用API、执行代码,一次任务可能经历十几轮“推理-操作-观察”,每一轮都在GPU与CPU之间切换。
GPU仍负责最重的模型计算,但解析模型输出、判断工具类型、发起请求、运行程序、管理文件、收集结果和安排下一轮任务等工作,通常由CPU处理。AMD计算与企业AI副总裁Madhu Rangarajan称,在公司测试的一条真实智能体流水线中,8个阶段有7个完全运行在CPU上。这个比例来自AMD自测,不一定代表所有系统,但足以说明模型推理只是智能体完成任务的一环,之外的所有协调工作都压在CPU上。
单个Agent的开销可能不大,但规模化后相当恐怖。企业部署给数万名员工后,并发任务迅速膨胀,每个智能体都在解析输出、执行代码和读写数据,CPU开销积累成容量需求。CPU处理得慢,GPU就要等待下一轮推理所需的输入。安全检查也增加负担:智能体权限越多,系统越需要检查文件、接口和敏感数据,规则匹配、日志分析和小模型审核通常留在CPU上,因为任务分散、延迟敏感,单独调用GPU未必划算。
另一个容易被忽视的负担是分词。大模型处理文本前要把文字转换成Token,这个过程包含大量字符串处理和条件分支,不像矩阵运算那样适合GPU。普通对话输入短,分词延迟没有存在感;智能体会不断积累工具返回结果、代码、日志和历史操作,输入可能增长到数万甚至数十万个Token。
佐治亚理工学院博士生Euijun Chung在接受IEEE Spectrum采访时举例称,在一些实现中,已有10万个Token的上下文再加入1,000个Token的工具结果,分词器仍可能重新处理整段输入。前缀缓存和增量分词可以减少重复工作,所以这并非所有系统必然采用的方式,但长文本带来的CPU压力仍然存在。
Chung团队在最新论文中测试了Llama 3.1和Qwen3等模型。在长序列、大批量配置下,分词最高占到首个Token延迟的约80%。当CPU核心数不足,分词线程还会与任务调度和GPU内核启动争抢资源,导致CPU满载、而GPU未能跑满。增加CPU核心后,不同配置的首个Token延迟改善了1.47-5.15倍,而无需增加GPU。
产业数据已经开始回应这一变化。2026年1月,KeyBanc根据供应链调查判断,Intel全年大部分服务器CPU产能已经售出,AMD的服务器CPU供应也接近满载,两家公司因此拥有了提价空间。这是分析机构的渠道判断,并非厂商披露的订单数据。
Intel随后的财务文件给出了部分印证。公司称,服务器CPU需求在2026年第一季度超过可供应数量,内部产能限制预计持续至年底。服务器产品平均售价同比提高27%,出货量却下降了5%;Intel将价格上涨归因于高端产品占比提升、需求定价和成本增加。
AMD同期的数据中心业务收入达到58亿美元,同比增长57%,增长同时来自EPYC服务器CPU和Instinct GPU。AMD没有单独披露服务器CPU收入增速,因此无法把这57%全部归因于智能体需求。公司对未来的判断更加激进:AMD此前预计服务器CPU市场年增长约18%;2026年5月又将预期提高到35%以上,预计市场规模到2030年超过1,200亿美元。
数据中心过去常用一颗CPU管理4-8颗GPU。AMD观察到,智能体系统正把这一比例推向1∶1,部分负载使用的CPU甚至更多。这仍是供应商根据客户需求作出的判断,工作负载不同,实际配置会有很大差异。比例变化的方向却很清楚:多配几颗CPU已经不够,云厂商开始考虑为智能体单独建设CPU机架。
Arm也在2026年3月第一次从出售处理器设计方案走向直接出售数据中心CPU。其AGI处理器最多拥有136个核心,由Meta参与开发。Arm预计,同等功耗下,智能体数据中心需要的CPU容量可能达到现有数据中心的4倍以上。高通随后发布拥有超过250个核心的Dragonfly C1000,并与Meta签署多代服务器CPU合作协议。
Intel、AMD、Arm、高通和英伟达在几个月内把“智能体CPU”写进各自的产品路线,说明这轮竞争已经越过传统的x86市场,扩展到Arm服务器、自研核心和整机架设计。英伟达在其中占据特殊位置:它既销售造成CPU压力的GPU,也销售缓解压力的Vera;从处理器、网络到存储,整套设备都可以由英伟达提供。Vera因而不只是一次产品线扩张,它还要保护GPU的利用率。
芯片厂商跟着钱走的时候,总有人要承担代价。和GPU、存储芯片一样,这次产能的变化很可能又是由消费者来买单。Intel在2025年第四季度财报电话会上承认,公司正在尽量把内部晶圆供应转向数据中心,同时增加客户端产品的外部代工;管理层随后补充说,Intel也不能完全退出客户端市场。
到了2026年第一季度,Intel客户端CPU的平均售价同比上涨16%,销量下降13%,公司预计供应限制至少持续至上半年。客户端产品的变化不能全部算在智能体头上,Intel自身的制程切换、内外部产能和内存供应同样影响了价格与出货。但在有限产能中,服务器芯片核心更多、售价更高,云厂商又愿意签订长期订单,生产资源自然也就开始向数据中心倾斜。
过去三年,普通消费者已经见识了GPU涨价和断货的滋味。接下来,同样的事可能发生在CPU上。
本文综合了英伟达官方公告、AMD高管博客、IEEE Spectrum报道、学术论文、KeyBanc渠道调查及Intel/AMD财报信息。其中,AMD的CPU占比、KeyBanc的产能判断、Arm的容量预测等均来自供应商或分析机构的自述,未经独立验证,标注为来源声称。Intel和AMD的财务数据来自公司财报,属于确认事实。
AI智能体的兴起正在重塑算力需求结构,CPU从配角变为关键瓶颈。英伟达、AMD、Arm、高通等厂商竞相布局,服务器CPU供不应求,价格与出货量出现背离。这场变革可能最终由消费者通过CPU涨价买单。
主报道
主报道来源