为什么CPU重新变得重要:Agent把“算力王座”从GPU独霸,拽成了GPU+CPU双核时代

日期:2026-09-26 20:35:25 / 人气:6



过去两年半的AI叙事里,CPU像个被遗忘的配角:大家只聊H100、Blackwell、显存带宽、FP8、集群互联。好像只要GPU够多,世界就赢了。

但云端Agent(Claude Task / Tag、Grok Bot、Muse、Instinct、ChatGPT Work、Claude Code Projects)起来之后,故事变了:

未来数十亿个Agent在云端7×24干活,瓶颈会从“模型推理”外溢到“让模型把事真做完”——而这件事的主战场,是CPU。

01 从Chatbot到Agent:一次往返 → 上百次往返

Chatbot时代的工作流是:
用户问 → GPU推理 → 出答案

一次往返,GPU说了算,CPU只在最外层做点网关、序列化、鉴权,存在感极弱。

Agent时代的工作流是:
思考(GPU)→ 开浏览器(CPU)→ 读文件(CPU)→ 跑代码(CPU)→ 调API(CPU)→ 存状态(CPU)→ 再思考(GPU)→ ……循环几十到上百次

模型推理仍吃GPU,但“调用工具、操作文件系统、管理登录态、跑沙箱、做网络请求、维护上下文状态、多Agent交换资料”全是CPU活。

本地Agent(Claude Code、Codex)阶段,这些CPU活儿靠你笔记本的核扛着,数据中心没感觉。
等Personal Agent默认上云、每人配一台“持久云电脑”、一个人开5个Agent、Agent半夜帮你等酒店回邮——CPU负载 = 人数 × 并发Agent数 × 单Agent执行时长,指数级往外冒。

AMD自己先改口:
• 2026年5月:2030年服务器CPU市场1200亿美元;

• 2026年7月:上调到2200亿美元;

• 间隔两个半月,苏姿丰原话是“过去六到八个月反复改数字,还是低估”。

Intel更直白:2026年9月陈立武说“CPU需求太高,只能向一半客户供货”。
Muse登顶App Store免费榜、AMD股价单日+10%进万亿俱乐部——市场终于反应过来:Agent不是GPU的附属品,是CPU的新用户。

02 两种CPU角色:Host CPU 是贴身助理,Agentic CPU 是执行团队

把AI系统想成一家公司:
• GPU = 贵得离谱的天才(做判断、出方案)

• Host CPU = 天才的贴身助理(不断给GPU喂数据、搬权重、管PCIe/NVLink、减少GPU空转)

- Agentic CPU = 成建制的执行团队(开浏览器、下财报、跑单测、填表单、存状态、跨Agent传文件)

Host CPU:拼单核、拼互连、拼内存就近

GPU贵,空等一秒就是烧钱。Host CPU核心是:
• 单核性能好(任务调度别卡)

• 与GPU互连宽(CXL、NVLink、PCIe 6/7)

• 近内存/近显存(把预处理、token拼装、KV cache搬运做快)

这部分不是新需求,但Agent化之后“喂活频率”翻几十倍,Host CPU不能再是廉价至强凑数。

Agentic CPU:新品类,可独立扩容

重点在这层。
Agent长程任务里,执行侧工作量会超过推理侧。比如:
• 比价10个酒店网站(网络IO + DOM解析 + 状态表)

• 跑一个pytest套件(进程管理 + 磁盘 + 子进程)

- 监看邮箱等回复(长连接 + 定时器 + 存储)
• 3个Agent协同写PR(文件锁 + diff + 权限 + 日志)

这些事“不太聪明但极吃系统调用、IO、上下文保活”。全塞给Host CPU,会拖慢GPU喂料;单独搞一层Agentic CPU / Agent Execution Fabric,成机架、成集群部署,才是数据中心新物种。

Intel的P-rack(重单核性能)和E-rack(重并发效率/成本)就是按这个思路切的:
• 跑“等网页、等API”的多到爆炸 → E-rack,核多、便宜、能并发;

• 跑“单步编译/单线程脚本/强一致状态机” → P-rack,单核猛;

• 未来调度器按workload分人:像HR排班。

03 为什么是“持久云电脑”把CPU打爆

两种云Agent架构,CPU消耗完全不同:

临时沙箱(Claude Tag类)
任务来 → 起沙箱 → 跑完销毁。
CPU是脉冲式:有任务才烧,没任务回收。虽省资源,但Agent每次都得重新登录、重新搬上下文、重新建环境。

持久云电脑(Grok Bot / Muse / Instinct类)
每个用户一台常住虚拟机:OS、浏览器、Cookie、文件夹、状态表全在云端。
- 你关笔记本 → Agent继续等邮件;
• 今天查完日本酒店 → 明天接着调航班;

• 5个Agent共用一个工作区 → 互相传文件不重来。

这种形态对CPU是常驻型负载:
内存常驻、定时器常驻、浏览器常驻、网络长连接常住、状态机常驻。
10亿Personal Agent = 10亿台常驻云电脑 = 人类历史上最大规模的“操作系统实例膨胀”。

GPU按token计费,CPU按“活着的Agent×秒”计费。后者才是云厂商的电费噩梦。

04 软件层的新金矿:异构调度

硬件变复杂之后,瓶颈从“有没有芯片”变成“会不会排班”。
Agent一次任务里:
• 推理 → GPU

• 抓网页 → 网卡+CPU

• 跑pandas → 大核CPU

• 等第三方API → 别占贵CPU,丢E-rack

• 写向量库 → 内存带宽敏感

• 再推理 → 回GPU

Gimlet Labs这种异构推理云的价值就在这:不是卖卡,是把电力、显存、核数、网卡、内存按任务切片。a16z领投3亿美元B轮,买的不是“又一家Infra”,是“Agent时代的操作系统调度层”。

未来数据中心老板要回答的问题不是“买多少H100”,而是:
我该配多少P-rack、多少E-rack、多少GPU、多少网卡、多少近内存、多少沙箱池,才能让一个Agent跑完“订日本酒店+写周报+修bug+等客户回邮”还不亏电?

这问题,比训练大模型难。因为训练是批处理,Agent是混沌长尾。

05 为什么“CPU重新重要”是地缘和产业信号

• Intel/AMD受益:GPU被英伟达锁死,但Agentic CPU是x86/ARM新战场;

• 云厂利润被重算:原来卖GPU时长是印钞,现在常驻Agent虚拟机是耗电+耗核+耗内存,毛利率重排;

• 终端侧没完:本地Agent用笔记本CPU,消费级CPU(笔记本/手机/PC)也因Codex类工具回春;

、

• 中国机会:GPU被卡,但Agent执行层(鸿蒙/欧拉/异构调度/飞腾+鲲鹏+玄铁)、国产CPU走Agentic workload,是另一条不被CUDA锁死的路。

06 一句话收口

Chatbot吃GPU,Agent吃CPU。

GPU决定“它聪不聪明”,CPU决定“它能不能把事真干完”。

当数十亿Agent在云端有了自己的桌子、浏览器、文件夹和待办列表,CPU就从配角变主角——不是因为它更聪明,是因为世界的大部分工作,本来就是笨活、碎活、等活、搬活。

AI的上半场是“让机器会想”;
AI的下半场是“让机器替你把事跑完”。
后者的电费、核数、调度、状态、沙箱、登录态、文件锁,全写在CPU的账本上。

所以CPU重新重要,不是复古,是Agent把“执行”这件被忽略的事,重新还给了基础设施。

GPU是大脑,Agentic CPU是手和腿。
大脑再强,没有腿,模型也只是个会说话的瘫子。

作者:耀世娱乐-耀世注册登录平台




现在致电 8888910 OR 查看更多联系方式 →

COPYRIGHT 耀世娱乐-耀世注册登录平台 版权所有