AI工厂是相互关联的系统,集群效益取决于整个技术栈将电力和算力转化为已完成智能体任务的效率。GPU负责运行模型,CPU则处理任务编排、工具执行和沙箱计算。与具有稳定运行时特征的传统计算不同,智能体工作负载具有高度不可预测性和动态变化性。基于对163,594个智能体会话的遥测数据,超过97%的会话呈现出独特的运行轨迹特征(图1)。这种多样性使得通过多种专用CPU设计方案来合理配置集群规模变得极不现实。
生产环境的遥测数据还揭示了这些多样化轨迹的展开方式:在各类会话中,执行过程遵循一条漫长的顺序推理链,其间穿插着零星爆发的并行工作。真实数据表明,主导性的顺序路径严格受延迟制约,决定着整个会话的完成时间;而短暂的扇出操作则需要兼具可用线程并发能力和低延迟的单线程执行能力。
AI工厂并不需要针对孤立的工具调用场景拆分集群,而是需要一个统一、均衡的CPU设计方案。NVIDIA Vera CPU正是为此而设计——在典型智能体工作负载上提供卓越的单核性能,加速关键路径执行,同时承接间歇性的扇出突发需求。以下各节将深入分析智能体轨迹背后的遥测数据,并展示Vera CPU的均衡架构如何优化真实集群的经济效益。
智能体轨迹的形态特征
智能体轨迹的形态由其长度和宽度两个维度决定(图2)。
长度:指智能体在完成一次交互之前所需经历的推理步骤、工具调用、重试操作和子任务的总数量。
宽度:指每个阶段扇出的工作量,包括并发工具调用、检索操作、沙箱实例或子智能体的数量。
一个会话可能具有相当大的宽度,但仍将大部分实际运行时间耗费在等待顺序链上,因为并行爆发是短暂的,而底层依赖链则贯穿整个运行过程。即便在大规模扇出期间,单线程延迟依然至关重要。主智能体在推进至下一步骤之前,往往需要等待所有并行任务全部完成。CPU集群必须针对完整轨迹进行优化:既要提供足够的并发能力以承接扇出爆发,又要具备强劲的单线程性能,以加速最终决定端到端完成时间的顺序路径。
这正是智能体CPU集群的优化目标应当是已完成用户会话总数,而非原始核心数量的原因所在。高核心数系统在纸面上看起来效率很高,但往往需要作出权衡取舍——为达到核心密度目标,不得不牺牲单线程性能,而单线程性能恰恰是降低智能体关键路径延迟的关键所在。
当顺序执行的延迟敏感型任务被迫运行在性能较弱的核心上,或在大规模并行异构集群中遭遇高同步开销时,智能体工作流的效率就会大打折扣。面向智能体工作负载的均衡CPU,必须同时具备足够的核心数量以承接并发工具执行和子智能体扇出,以及强劲的单线程性能以加速主导整体智能体延迟的顺序步骤。
真实遥测数据的验证
上述判断可以通过真实的智能体遥测数据加以验证。在图3所示的真实Claude Code会话中,主智能体在长达33分钟的运行过程中,绝大多数时间都在推进一条漫长的顺序轨迹。
遥测数据清晰呈现了智能体工作负载形态的两个维度:显著的扇出现象和漫长的依赖链。子智能体活动制造了必须被快速处理的并行工作突发,但完整的用户交互轮次仍然沿着有序的主轨迹推进,每一步都依赖上一步的解锁才能继续。因此,CPU集群既需要足够的并发能力无延迟地吸收扇出突发,又必须在决定端到端完成时间的延迟敏感路径上持续保持强劲的单线程性能。
在任意给定时刻,CPU可以通过"关闭"部分核心来临时提升单线程性能。但这种做法可能导致每核心8 GB内存处于闲置状态,并带来显著的内存总拥有成本损失(图4)。一个设计均衡的CPU应当针对完整工作负载轨迹而非任何单一阶段进行优化。通过将强劲的单线程响应能力、充足的并发支持、充裕的内存带宽和高效的功耗管理有机结合,这一设计理念在高效利用CPU核心、DRAM、GPU HBM及更广泛内存层级的同时,最大化了已完成用户交互轮次。
Vera CPU的架构与性能表现
Vera CPU正是为此运行点而生,搭载专为持续强劲单线程性能而设计的NVIDIA Olympus核心,即便在整颗CPU满负荷运行时亦能保持这一特性。宽幅前端、先进的分支预测、深度乱序执行以及高带宽内存子系统,帮助每个核心在面对庞大代码规模、分支密集的控制流、动态运行时和依赖密集型执行时,始终保持稳定的前向推进能力。上文中的Claude Code数据表明,智能体工作负载正需要这种均衡设计:既有并发能力以吸收扇出,又有单线程速度以推动主导性顺序路径持续运转。
图5中的SPEC CPU(R) 2026预估成绩对这一设计方案进行了实测验证。测试结果突显了Vera CPU在典型智能体工作负载(包括编译器、静态分析和Python基准测试)下满载时的单核性能,并展示了Olympus如何在不牺牲智能体关键路径所需性能的前提下处理并发任务——NVIDIA Vera CPU在智能体性能上最高可达最新竞品的1.5倍。
构建高效的智能体AI集群基础
Vera CPU为智能体AI集群提供了更高效的基础平台,因为它是针对真实智能体轨迹的全谱特征而设计的。满载运行时的强劲单线程性能使延迟敏感的顺序路径保持高速推进,而跨核心的高并发能力和充裕的内存带宽则能承接间歇性的工具调用和子智能体扇出。Vera CPU的低延迟单片架构进一步减少了由拓扑结构引起的停顿和这些阶段间的性能波动。
这一均衡设计有助于避免资源闲置:无论在顺序工作还是并行爆发阶段,核心都保持高效运转,与这些核心绑定的内存也得到充分利用,而非挂载在低效运转的算力上。同时,这也降低了为应对不可预测的工具调用模式而在集群中配置多种专用CPU设计方案的必要性。
最终结果是一个能够将算力、内存带宽和功耗转化为更多已完成智能体交互轮次的CPU平台,从而在规模化部署中提升AI工厂的产出效率和集群经济效益。
如需深入了解NVIDIA Vera CPU架构与性能详情,请参阅NVIDIA Vera CPU技术白皮书。
NVIDIA Vera SPEC CPU(R) 2026测试结果于2026年7月在内部完成测量。测量方法和配置详情请参阅NVIDIA Vera CPU技术白皮书。AMD Venice测试结果基于相关链接数据,Venice各项工作负载的性能系根据SPECrate(R)2026_int_base基准分数2070估算,各子项基于内部Turin测量结果进行归一化处理。实际结果可能因环境而异。
SPEC(R)、SPEC CPU(R)及SPECrate(R)均为标准性能评估公司(www.spec.org)的注册商标。
本项工作的完成离不开Ivan Goldwasser、Diana Aung、Hannah Coutand、Ian Finder、Benjamin Klieger、Arnav Jaiswal、Dylan Mitic及众多其他成员的专业贡献与深刻洞见。
Q&A
Q1:NVIDIA Vera CPU是针对什么问题设计的?
A:Vera CPU专为智能体AI工作负载的特性而设计。传统CPU难以同时应对智能体任务的两种核心需求:一是长链顺序推理带来的低延迟单线程性能需求,二是并发工具调用和子智能体扇出带来的高并发处理需求。Vera CPU通过搭载Olympus核心,结合宽幅前端、深度乱序执行和高带宽内存子系统,在满载运行时同时满足这两种需求,避免了集群中资源闲置和性能瓶颈的问题。
Q2:NVIDIA Vera CPU相比竞品性能提升有多大?
A:根据NVIDIA于2026年7月内部完成的SPEC CPU(R) 2026预估测试,Vera CPU在典型智能体工作负载上的性能最高可达最新竞品的1.5倍。测试涵盖编译器、静态分析和Python等基准项目,重点验证了Vera CPU在满载状态下的单核性能表现以及在不牺牲关键路径性能的前提下处理并发任务的能力。
Q3:智能体会话的轨迹数据说明了什么问题?
A:基于163,594个智能体会话的遥测数据显示,超过97%的会话呈现出独特的运行轨迹特征,说明智能体工作负载高度动态且难以预测。真实的Claude Code会话数据进一步表明,在长达33分钟的典型运行过程中,主智能体大部分时间都在推进顺序依赖链,期间穿插短暂的并行扇出。这意味着端到端完成时间主要由顺序路径的延迟决定,CPU必须优先保障单线程性能,而非单纯追求核心数量。