据 Digital Applied 统计预计到 2026 年底超过 80% 的企业应用将至少嵌入一个 AI 智能体IDC 预判到 2031 年中国企业场景中的活跃 AI 智能体数量将达到 3.5 亿个美银证券预测到 2029 年中国 AI 数据中心固定资产投资规模将超过 2.2 万亿元人民币。更值得关注的是基础设施侧的预期变化。英特尔数据中心集团副总裁、中国区总经理陈葆立在云栖大会英特尔专场披露短短半年内针对 2030 年服务器 CPU 市场规模的预测已从 2026 年 2 月的 590 亿美元上调至 8 月的 2100 亿美元。与之对应英特尔 2026 年第二季度财报显示数据中心与人工智能业务DCAI营收 63 亿美元同比增长 59%。Token 消耗量的增长同样显著 —— 中国国内大模型日均 Token 消耗量已达约 500 万亿仅 2026 年 8 月单月消耗量即达 15000 万亿。在这样的背景下9 月 23 日以 智启 Agent・算筑中枢 为主题的英特尔专场传递出一个明确信号随着智能体负载从单轮对话走向多步执行CPU 在 AI 基础设施中的角色正在发生变化。英特尔方面将这一变化概括为 CPU 重回 C 位。CPU 角色为何变化从单轮到多步执行英特尔技术专家李尔成在现场给出了一条工作负载结构曲线AI 在数据中心工作负载中的占比预计将从 2025 年的 23% 提升至 2030 年的 50%其中推理占 37%、训练占 13%。换言之未来五年增量最快的 AI 负载并非训练而是推理 —— 并且是以智能体形式持续运行的推理。这一变化的总量背景是据仲量联行《2026 年全球数据中心展望》全球数据中心容量预计将在 2025 年至 2030 年间接近翻倍。其中传统基础性工作负载并未消失到 2030 年仍将占据约半壁江山企业级 x86 服务器装机量预计将从 2025 年的约 6300 万台增长至 2030 年的约 7600 万台占全球服务器装机量约 80%。AI 增量与存量工作负载叠加构成了 CPU 市场预期被大幅上调的基础。传统单轮推理的计算主要集中在模型生成环节由 GPU 或 AI 加速器承担CPU 负责前后处理。智能体负载则不同。英特尔技术专家胡勇介绍一个用户请求会触发一个 Agent Loop在 P90/P99 统计口径下完成一个复杂任务这个 Loop 可能重复数十次甚至上百次每一轮中除模型推理外规划调度、工具调用、API 请求、沙箱拉起、状态回滚、结果校验等环节均由 CPU 参与。英特尔技术专家谢义补充由于 CPU 任务与 GPU 任务存在前后依赖CPU 处理时间可能直接构成 GPU 的等待时间。基于这一变化英特尔方面提出智能数据中心中 CPU 与 GPU 的配比可能从传统的 1:4 向 1:1 演进部分高并发场景中 CPU 数量甚至会超过 GPU。陈葆立将 AI 数据中心归纳为三类集群 ——CPU 集群、GPUAI 加速器集群和存储集群并指出三类集群均需 CPU 参与调度与数据传输。原生 Agentic CPU 尚未出现值得注意的是对 CPU 重回 C 位 这一判断阿里云智能集团资源总监、首席服务器架构师卓久在同一场合提出了边界条件。对于当下这些被称为 专为 Agentic AI 而生 的 CPU我认为这种说法并不准确。如果一款 CPU 从 2026 年 3 月开始设计未来可能确实能满足很多 Agentic AI 的需求但当下我们看到的 CPU只是在 Agentic AI 的某些环节上具有优势并不是专为 Agentic AI 而设计的。这一判断与英特尔技术团队的表述一致。胡勇在其分享中明确表示到现在为止我们不认为市面上有一个专为 Agentic AI 而生的 CPU。从产品周期看这一判断有其依据。一颗数据中心 CPU 从架构冻结到规模出货通常需要两到三年。当前在阿里云第九代 ECS 实例上大规模部署的至强 6Granite Rapids其架构定义时间约在 2022 至 2023 年彼时智能体尚未成为主流工作负载。真正按智能体负载需求反向设计的产品是英特尔在云栖大会上披露的下一代至强处理器 Diamond RapidsDMR。根据现场公布的信息DMR 最高支持 256 个核心首次采用 Fan-out Fabric 架构两个 Fabric Hub Die 与八个计算 Tile 全连接末级缓存容量达 1.28GB配备 16 个内存通道、1.6TB/s 内存带宽支持 12800MT/s MRDIMM提供 128 条 PCIe 6.0 通道双路之间最多可配置四条 x16 链路。指令集方面APX 将通用寄存器数量从 16 个扩展至 32 个并引入三操作数设计英特尔方面给出的 SPEC CPU 2017 实测数据显示支持 APX 的编译版本可使 Load/Store 指令数量减少约 40%。英特尔技术专家龚海峰解释智能体负载对 CPU 前端较为敏感 —— 任务切换频繁、状态切换多、I/O 等待占比高。上述架构改动的方向是通过扩大寄存器、提升缓存容量、均衡内存通道访问路径减少 CPU 空转与数据搬运。他同时强调评估一个系统能承载多少智能体不能只看硬件硬指标而需在满足 P99 时延 SLA 的前提下考察 CPU 调度有效性、资源平衡度和计算卸载效率三个转换系数。DMR 计划于 2027 年推出。瓶颈外溢内存、KV Cache 与存储现场分享的一个共识是智能体负载带来的压力并不集中在 GPU 单卡算力而是沿整个系统扩散。在内存侧胡勇给出了一组测算每个智能体运行实体平均占用约 2GB 内存客户高密度部署要求一个 CPU 核心运行 2 至 4 个智能体对应每核 4GB 至 8GB 内存。当前 12 通道内存、128 至 288 核的平台即使满配也只能支撑 1:4 至 1:8 的内存配比。英特尔方面提出的应对包括两方面硬件层面通过 CXL 扩展内存池软件层面利用 CPU 内置的 IAA 内存分析加速器进行内存压缩。英特尔给出的数据显示压缩比约为 2:1硬件压缩速度约为纯软件方式的 11 倍、解压约 12 倍。在 KV Cache 侧谢义披露要达到 75% 的 KV Cache 命中率上限系统需缓存约 300 万 Token以 MiniMax-M3 为例对应约 450GB 内存。对此英特尔提出的方案包括利用 CPU 较大的内存容量承接 MoE 架构中溢出的热点专家计算利用 DSA 加速器进行小数据块小于 64KB的高效搬移利用 QAT 对 KV Cache 进行压缩。现场公布的数据显示KV Cache 传输带宽最多可提升 9.66 倍无损压缩率提高 1.42 倍首 Token 延迟最多改善 15 倍。配套的 KV Cache 智能加速套件含 KV Infinity、KV Cascade、KV Fuse、KV Shrink 四个组件已在 GitHub 开源。阿里云 PolarDB 团队陈浩给出的线上验证数据为将 GPU 上的 KV Cache 卸载至远端分布式内存池后TTFT 降低 61%端到端延迟降低 53%。在存储侧英特尔资深存储架构师曹刚介绍基于至强 6 的 JBOF 方案通过 RDMA 单跳访问远端 SSD额外延迟约 10 微秒本地盘约 50 至 60 微秒在 Qwen-2.5 32B、8000 输入 Token 的典型配置下配合 QAT 压缩可实现 5 至 8 倍吞吐提升。阿里云块存储团队彭艺蕾披露在至强 6 平台上通过 DDIO、DSA、QAT 及 UINTR/TPAUSE 指令的软硬协同单线程能力提升 40%压缩带宽提升 400%参与压缩的 CPU 核数下降 75%磐久第九代存储服务器整体吞吐达到上一代的 4 倍相关优化已在阿里云生产环境大规模部署。在浏览器执行环境侧阿里云终端智能与英特尔联合展示了 Agentic Browser 实践。基于 Chromium 主干对 Blink/V8 进行面向智能体场景的裁剪结合 AVX-512、IAA、QAT 等硬件能力单实例内存开销最多降低约 30%支持单个智能体并行启动数百个浏览器实例。阿里云高级产品专家蒋佳忆介绍系统将首次跑通的网页流程沉淀为可回放的 RPA Workflow同类任务优先重放脚本、异常再切回主 Agent其给出的成本对比显示通用办公 Agent 完成一次小红书发帖任务的 Token 消耗约为复用沉淀 Workflow 方案的 100 倍。软件生态用智能体迁移 CUDA除硬件架构外英特尔技术专家汪洋分享了一项与开发者关系更直接的实践利用 AI Agent 辅助将 CUDA 代码迁移至英特尔 GPU 平台。传统上从 CUDA 迁移至其他 GPU 平台主要依赖人工重写或 API 直译工具前者周期长后者常因微架构差异造成性能损失。英特尔方面提出的方法分两步首先由大模型基于算法意图进行语义级迁移使用 SYCL 重构代码而非逐行翻译其次将 Profilling 硬件指标反馈给 Agent配合提供的微架构优化 Skill 自动定位瓶颈并调优形成 写码 — 编译 — 验证 — 调优 闭环。现场公布的评测数据显示从开源社区选取 10 个项目共 468 个算子Agent 完成 445 个完成率 95%单算子交付成本约 0.6 美元、耗时 7.9 分钟每千行代码交付成本 0.98 美元、耗时 12.8 分钟。在 Llama.cpp 案例中Agent 迁移的 107 个算子中有 45 个经优化后性能超过原有人工手写版本。这一实践的产业意义在于当单算子迁移成本降至不足 1 美元跨 GPU 架构的迁移经济性正在被重写。英特尔方面将其定位为 算法创新与硬件适配解耦但对企业用户而言更直接的含义是硬件选型的议价空间与部署灵活度可能随之扩大。几点观察综合现场分享可观察到以下几点。其一CPU 重回 C 位 的准确含义是 CPU 在推理与编排侧的相对权重上升而非 CPU 替代 GPU。在训练与大模型 Prefill 阶段GPU 仍是主要计算载体智能体时代的趋势是异构分工进一步细化 ——GPU 承担密集矩阵计算CPU 承担编排、工具调用、小模型推理与数据预处理专用加速器承担搬移、压缩等卸载任务。其二当前数据中心部署的 CPU 并非为智能体原生设计。卓久与胡勇的表述指向同一事实2026 至 2027 年的智能体基础设施仍主要依靠上一代 CPU 产品的通用能力适配新负载。真正面向智能体设计的 DMR 要到 2027 年推出采购评估时不能仅看核心数与频率还需考察内存容量配比、加速器软件成熟度以及在 P99 时延约束下的实际智能体承载密度。其三智能体规模化的成本压力正在催生新的工程重点。无论内存压缩、KV Cache 分层还是 RPA Workflow 沉淀、端侧小模型部署目标都指向同一方向 —— 降低单位任务的 Token 消耗与硬件成本。阿里云千问团队披露的端侧实践可作为参考35B-A3B 模型经混合精度量化与分层卸载后权重从 70GB 压缩至 12GB在英特尔酷睿 Ultra X7 358H 上达到约 50Token/s。其四开放软件栈的价值正在上升。从 PyTorch、vLLM 到 SGLang英特尔强调其 AI 软件栈以上游开源方式参与社区并通过 AI Agent 辅助迁移降低跨架构门槛。对开发者而言硬件层的可替换性增强意味着需要更早地将 TCO、时延 SLA 和迁移成本纳入长期架构评估。这在一定程度上反映了当前智能体基础设施建设的现实状态 需求增长明确商业模型仍在验证之中。CPU 角色的变化是这一进程的一部分而非全部答案。
