Skip to main content

算力革命与云厂商三重进化:Agent云的架构升级与"度量衡革命"

节目信息

  • 栏目:硅谷 101
  • 主持:陈茜
  • 发布时间:2026-07-22
  • 采访嘉宾
    • 郑然 —— 百度杰出架构师、百度智能云技术委员会联席主席
    • 鞠笑竹 —— 北京人形机器人创新中心大模型负责人
  • 主题:云产业从互联网云、GPU 云到 Agent 云的三重进化,以及从 Token 消耗转向任务交付的"度量衡革命"

云的三重进化

把时间拉回到 2006 年,亚马逊推出 EC2,把计算资源变成像电力一样按需获取、按需付费的服务,云计算时代才真正拉开序幕。随后二十年里,云产业形成了一套稳定的 IaaS / PaaS / SaaS 三层能力栈,服务的对象是网站、社交平台、企业软件这类应用,应用去消耗计算资源,CPU 是数据中心里绝对的主角。那个时候没人会想到,云会经历一次又一次彻底的自我改造。

转折发生在 2022 年底。ChatGPT 把市场对算力的需求推到了完全不同的量级,云的服务对象从应用转向模型。云的能力开始围绕大模型的训练而变化,硬件底座从 CPU 变成 GPU,平台层从数据库、中间件、开发工具,转向模型训练、部署、推理、加速、向量数据库、RAG、模型管理。Vertex AI、Azure AI Foundry、Bedrock、千帆、百炼——这些新平台本质上都是想把模型训练、推理、微调、应用开发封装起来,让企业像用云服务一样使用 AI。

进入 2025 年下半年,随着 Anthropic Model Context Protocol(MCP)等 Agent 底层协议出现,以及 OpenAI 等开源框架的爆红,企业开始真正把模型能力转变为生产力。云由此进入第三阶段:Agent 云。云不再只是卖算力、卖 Token、卖模型调用,它必须同时提供推理、存储、工具、记忆、沙箱、安全在内的完整 Agent 运行环境,解决的是智能体如何稳定运行、如何大规模部署的问题。这不是一次小修小补,而是过去二十年云产业最大的一次架构升级。

为什么 90% 的 Agent 都会掉链子?

模型能力这两年实现了跨越式进步,能写代码、能分析数据、能撰写报告,甚至在不少专业测评里超过了人类水平。但一落到企业实际工作里,一个尴尬的现实是:有 90% 的企业反映 Agent 在实际工作中会掉链子。

原因出在 Chatbot 和 Agent 的本质差异上。Chatbot 时代,用户的预期像搜索一样,提一个问题就要快速回应,云的优化目标自然是速度优先;但 Agent 时代,核心目标不是快速完成任务,而是高质量地完成任务。对底层系统而言,这意味着模型需要多轮推理、上下文长度远超 Chatbot 阶段、KV Cache 等存储基础设施必须能高效支撑大规模分布式推理。一个问答模型再聪明,也不等于一个能稳定干活的"员工"。

要支撑 Agent 稳定运行,还需要一套全新的操作系统——Agent Harness。它位于模型之上、应用之下,负责把模型真正组织起来:调用 MCP、使用工具、管理长期记忆、运行工作流,并在安全隔离的环境中稳定执行任务。Harness 决定 Agent 能否真正走向落地,而它本身又存在显著的木桶效应:工具、记忆、安全、隔离任何一个环节出现短板,整个系统的执行效果就会下降。这要求云厂商做的,不是单点能力的堆叠,而是把整套工程能力系统化打通。

鞠笑竹从聚身智能(具身智能)的视角补充了更严苛的要求:聚生 Agent 面对的是强物理交互场景,"不能幻觉"——既不能让机器人去执行它根本不存在的技能,也不能幻觉出环境中不存在的物品;而且用户对长任务的耐心很低,机器人不能长时间重规划、再尝试,追求的是 Pass@1 一次性成功率。这意味着 Agent 在真实生产环境里的运行标准,远比互联网时代的智能体更高。

Agent 云的新生产资料:GPU、CPU、HBM、光互联的协同运转

底层算力的变化是这一轮架构升级最直接的物质基础。大模型训练和推理依赖大规模并行计算,GPU 从数据中心里的辅助角色一跃成为最核心的生产资料,直接指数级推高了基础设施建设成本。从 2023 年开始,科技巨头们开启史无前例的资本开支扩张。

但 GPU 一家独大并不是终局。随着 Agent 进入真实生产环境,新的需求不断涌现:Agent 之间需要高速大规模互联,KV Cache 和 Agent 状态需要超高带宽存储,推理过程需要超低延迟网络,向量数据库需要海量并发读写。于是 HBM、光通信模块、先进封装 这些环节都变成了新的稀缺品,每一家股价飙升的公司,背后都对应着 Agent 云产业链上某个被重新发现的关键节点。

更值得注意的是 CPU 的回归。模型推理由 GPU 完成,而任务调度、工具调用、跨系统协作等大量执行工作又重新回到了 CPU 手里。云的核心生产资料,从大模型时代单一的 GPU,扩展到了 GPU + CPU + HBM + 光互联协同运转 的新体系。这是过去被边缘化的板块今年重新被市场关注的原因,也是 CoreWeave、Applied Digital(NBAS)等一批 Neo Cloud 公司快速崛起的底层逻辑。NBAS 自 2024 年 10 月复牌上市以来,股价已经涨了超过十倍,并在今年 6 月 22 日被正式纳入纳斯达克 100 指数,资本市场和真实产业需求双向加码。

不过中国和美国的产业格局并不相同。美国已经形成了相对独立的 Neo Cloud 赛道,而中国目前还没有催生这一独立类别——百度智能云、火山引擎、阿里云等超大云厂商,正在快速向 AI Native Cloud 演进,把 AI 算力、模型、训练推理服务等能力整合进自身平台,中国更多是在现有云平台上直接完成 AI 升级。随着 AI 工作负载的演进,云服务产业正在形成更清晰的能力分工:围绕算力、推理、Agent 运行、企业落地等不同环节,不同类型的云厂商都在围绕各自的优势构建核心能力。

度量衡革命:从"卖 Token"到"卖任务"

如果说算力层的变化是物质基础,那么产业层更深刻的变化是 衡量方式 的革命。

2026 年上半年,行业普遍喊的口号是 Token per Dollar、Token per Second——本质上衡量的是性能、效率和成本。这些指标非常重要,是 AI 规模化落地的基础,但在 Agent 时代已经不够。客户真正关心的是 AI 最终交付的价值,而不是过程中烧了多少 Token。

百度在今年的 Create AI 开发者大会上抛出了一个全新指标:DAA(Daily Active Agents,日活智能体数),把基础设施优化的目标从提升算力效率,转向提升智能成果。郑然在访谈中把这一转变讲得很清楚:Token 指标反映的是资源消耗、是成本;而 DAA 关注的是效果、是产出——希望整个行业能享受 AI 的技术红利,让更多 Agent 真正帮助人类去解决问题、去完成任务、去交付结果。从 Token 到 DAA,是 AI 产业从"拼投入"走向"比产出"的度量衡革命。

星云魔体:Agent 云的全栈系统工程

为什么只卖算力解决不了 Agent 落地的问题?因为 Agent 落地是一个系统工程——只做算力解决不了任务执行的稳定性,只做模型解决不了企业场景里的工具、数据、权限、流程,只做应用又很难反向优化底层推理成本和运营效率。

百度智能云给出的解法是"星云魔体"四层重构:

第一层是 AI 基础设施的重构——从服务于模型训练,转向服务于推理和 Agent,让每一个 Token 算得更便宜、更高效、更稳定。百度今年发布的百舸 6.0 AI 计算平台、昆仑芯集群和吉瓦级 AI 数据中心,共同构成面向推理和 Agent 时代的 AI 基础设施。

第二层是云平台的重构——云的形态从云原生到 AI 原生,再进入 Agent 原生,整套技术栈围绕智能体重新设计。千帆的"磁源工厂"和"嘉峪工程"能支持海量 Agent 在云上并发、提供 Agent 沙箱与 Guardrail、提供更长的上下文记忆与持久化对话。

第三层是模型的重构——从过去看参数规模和跑分,转向看模型能否真正融入客户业务、解决实际问题。

第四层是研发范式的重构——从人写代码、人验证,转向 AI 自主完成开发任务,让 Agent 直接调用云产品的服务和接口。

这四层不是单点能力的堆叠,而是 环环相扣的全栈布局:芯片需要运行在云基础设施之上,云和模型本身需要做紧密的优化与协同演进,模型和智能体之间也是协同演化的过程。芯片 → 云 → 模型 → 智能体,任何一层出现短板都会拖垮整体的执行效果,这正是 Agent Harness 木桶效应在云架构层面的对应物。

判断一套全栈 AI 云是否真正成立,最终要回到 最难的企业场景——百度智能云目前已覆盖 80% 的央国企系统、银行和 100% 的主流车企,在中国聚生智能云市场份额达到 35%,这些场景从一开始就是高并发、高可靠、高安全、高确定性的复杂生产系统。

把视角拉到全球,2026 年头部云厂商在 Agent 云方向做出了同一个动作:重构云的能力栈。微软在 Build 2026 上提出 Agent 将取代 PaaS + 操作系统的旧范式,并推出整套 Agent 全栈架构;谷歌在 Cloud Next 2026 上宣告服务了 5 年的 Vertex AI 退役,取而代之的是全新的 Gemini Enterprise Agent Platform,并同步发布第八代 TPU。这些动作都在说明一件事:AI 云的竞争正在从"谁能提供模型和算力",走向"谁能支撑 Agent 稳定运行和规模化交付",这是云厂商之间分水岭级别的能力较量。

当 AI 进入生产环境

把视角再拉远一些:从大模型到 Agent,云的角色在三年里换了三次。模型时代,云是"卖 Token 的算力供应商";Agent 时代,云必须变成"卖任务的智能体运行底座"。随之而来的是,衡量云价值的尺度也在重写——Token 不再是终极指标,有多少 Agent 真正在企业流程里完成任务、创造价值,才是新的度量衡。

这意味着云厂商要回答的问题变了。不是"你的 GPU 有多强",而是"你的 Agent 跑得多稳、能交付多少业务结果"。当 AI 开始进入生产环境、成为真实业务的一部分,云的下半场,才刚刚开始。