深度 | 算力正在变「自来水」:无服务器 GPU 与 Agent 执行层基础设施的 2026 拐点

深度 | 算力正在变「自来水」:无服务器 GPU 与 Agent 执行层基础设施的 2026 拐点
# 算力正在变「自来水」无服务器 GPU 与 Agent 执行层基础设施的 2026 拐点一、执行摘要2026 年 8 月 3 日Cloudflare 在 Agents Week 开源cloudflare/computer定位一句话「Give your agent a computer」。每个 Agent 获得一台秒级启动的隔离云机器——代码执行、浏览器、文件系统状态存放在 Durable Object 内的 SQLite 虚拟文件系统计算按需落在轻量 V8 isolate 或完整 Linux 容器上单日 891 星登顶 GitHub Trending。三天后Fly.io 宣布完成 $25M D 轮、全力押注「Computers for Agents」同一周却宣布 7 月 31 日起弃用 GPU 业务写下一篇《We Were Wrong About GPUs》[A]。这两个信号放在一起构成了 2026 年 Serverless GPU 最值得解读的图景GPU 本身正在被商品化价值从「拥有一块卡」迁移到「如何把算力按需、秒级、廉价地交给模型和 Agent」——也就是无服务器serverless这一层软件。市场在为此定价GPU-as-a-Service 市场预计从 2025 年 $8.21B 增至 2030 年 $26.62B26.5% CAGR[B]AI 推理市场从 $113.47B 增至 $253.75B17.5% CAGR。过去 18 个月Modal$4.65B、Baseten$5B、Together AI$8.3B、Fireworks AI$17.5B估值狂奔但没有任何一家披露实现现金流为正——钱在换增长不在换利润。我判断Serverless GPU 的卖点已经从「便宜」迁移到「省心 快」。2026 年的胜负手有两件一是快照技术把 70B 级模型的冷启动从分钟压到个位数秒二是「Agent 执行层」的归属——当 Cloudflare 把沙箱做成 CDN 内置能力独立沙箱厂商的商业模式正在被结构性挤压。二、为什么是 2026算力从「资产」到「自来水」的三股力量2.1 需求端推理越过了训练Agent 让负载变得极端2026 年推理已占 AI 算力需求超过 60%首次压过训练。但真正改变 serverless 成本结构的是 Agent 工作负载的形态Agentic 任务的中位运行时长约 8 分钟峰值内存是平均的 15.4 倍98.5% 的内存尖峰发生在工具调用期间而操作系统与容器初始化要吃掉端到端延迟的 56%-74% [A]。这意味着 Agent 负载天然「突发、短命、并行」——与 batch 训练的持续高占用完全不同恰恰是 scale-to-zero 的理想靶子。同时算力供给端全面收紧Blackwell 已售罄至 2026 年中新集群交付周期 6-7 个月H100 一年期租赁价格从 $1.70/时涨到 $2.35/时40%HBM 缺口 50-60%。需求 10x 对供给 3.4x 的剪刀差是 2026 年 GPU 定价全面上浮的根本原因。2.2 成本结构scale-to-zero 是一道利用率算术题serverless GPU 的经济学本质是「利用率套利」平台把大量客户的尖峰负载混在一起让总体利用率维持高位而每个客户只为自己活跃的秒数付费。但它的成立有边界综合各方数据专用实例只有在 GPU 利用率超过约 15%-25%中国市场测算约 52%时才更划算 [B]而 2026 年生产环境 GPU 的平均利用率只有约 5%。换句话说对大多数利用率不足的团队「自建反而更贵」——这正是 serverless 模式的结构性红利。上图Serverless GPU 的价值链——上游 GPU 所有者提供算力中间轻资产的 serverless 层做调度与按秒计费下游是编码、企业、计算机使用三类 Agent 应用。2.3 供给端涨价潮逆转了「推理价格只跌不涨」的惯性2025 年前 Token 价格两年降幅超 90%但 2026 年 4 月起涨价潮全面到来阿里云算力涨价 5%-34%、百度智能云 5%-30%、商汤训练套餐 12%、UCloud 15%、AWS ML 实例 15%。此前「推理价格低于算力成本」的倒挂正在被修复——这反而让按量付费的 serverless 模式在采购谈判中更有吸引力因为它的单价透明、且不绑定长期承诺。三、冷启动战争2026 年最大技术变量已经打完3.1 冷启动的解剖一次 vLLM scale-to-zero 冷启动Llama 3.1-8B / A10G约 33 秒由五段构成容器拉取约 8s、运行时初始化约 3s、权重下载约 12s、GPU 传输约 8s、CUDA graph 捕获与 warmup 约 2s。70B 级模型全冷启动要 2-5 分钟在交互式场景中不可接受。2026 年 6 月 MLSys 论文《Breaking the Ice》首次系统化研究得出一个反直觉结论瓶颈在 CPU 侧换更快的 GPU 并不能缩短启动时间[C]。3.2 破局点状态快照与恢复2026 年真正改变战局的是快照技术NVIDIA CUDA Checkpoint APICUDA 570进程级 lock/checkpoint/restore保留 device 内存、CUDA 内核含 torch.compile 产物与 CUDA graphvLLM 已提案原生集成Modal 用该 API 演示 10 倍冷启动改善Modal GPU 内存快照Ministral-3B 冷启动 118s→12s、Qwen2.5-0.5BvLLM 45s→5sRunPod FlashBootCRIU 式进程快照同机恢复 7-8svLLM 引擎子进程 PID 不变、无需重编译。上图冷启动的构成与破局——五段式全冷启动约 33 秒2026 年 CUDA Checkpoint、GPU 内存快照等快照技术把恢复压到个位数秒冷启动从「能不能用」变成「要不要付费」。3.3 推论冷启动之战已接近终局经济账随之重算平台侧 7B 模型冷启动已收敛到Baseten 10-15s、Modal 8-12s、Replicate 5-10s、RunPod 15-30sFlashBoot 恢复 7-8s。当冷启动进入秒级scale-to-zero 的适用范围从「批处理/离线」扩展到「交互式推理与 Agent 执行」。我原以为冷启动会是 serverless GPU 长期的天花板但 2026 年的快照技术基本把这个天花板拆掉了——剩下的约束只剩利用率算术。四、产品版图三极分化2026 年的 Serverless GPU 市场已分化为三个清晰的极极一 · 生产推理ModalPython 原生、app.function即部署H100 约 $3.95/时按秒计费、Baseten生产级 SLAH100 $6.50/时、Replicate5 万 预置模型已被 Cloudflare 收购、Together AI 与 Fireworks AI大模型推理平台。极二 · Agent 沙箱 / 执行层E2BFirecracker microVM约 150ms 冷启动无 GPU主打强隔离、ModalgVisor 容器、Cloudflarecloudflare/computerV8 isolate 容器双后端、Fly.io持久 VM 路线。极三 · 弹性低价算力Vast.aiP2P 市场H100 spot 低至约 $0.36/时但随时被回收、Hyperbolic、NebiusYandex 系B200 $3.95/时、Fal.ai生成式媒体H100 $1.89/时、NovitaL40S $0.55/时。大云厂商的座次值得单独点名AWS Lambda 至今无 GPUGPU 路径仍走 EC2/SageMakerGoogle Cloud Run 是 2026 年最成熟的 serverless GPUL4scale-to-zero 容器 5-7s 冷启动Azure Container Apps 支持 GPU 挂载但 Functions 尚不支持 [B]。大云的迟到给了独立厂商两年的窗口期。上图2026 年 Serverless GPU 的三极分化——生产推理、Agent 沙箱执行层、弹性低价算力各自成军三极之间互相渗透Modal 同时出现在极一与极二。五、市场与资本估值狂奔与「轻资产套利」5.1 融资全景2026 上半年公司最新轮次估值收入信号ModalC 轮 $355M2026.5$4.65B年化收入约 $300M [A]BasetenE 轮 $300M2026.1Nvidia 投 $150M$5BARR $30M2025.3→$600M2026 Q1Together AIC 轮 $800M2026.7Aramco Ventures$8.3B年化预定 $1.15BFireworks AID 轮 $1.5B2026.7$17.5BARR 超 $1BRunPodA 轮 $100M2026.6$1BARR $120M→约 $240M [B]Replicate被 Cloudflare 收购2025.11头条约 $550M / 实际对价 $57.4M [B]2024 年收入约 $5M这张表有三个耐人寻味的点。其一Baseten 一年内 ARR 从 $30M 涨到 $600M20 倍是整个赛道最激进的增长曲线 [B]。其二Replicate 的收购头条价与 SEC 披露的实际现金对价之间差了近 10 倍说明「serverless GPU 的退出估值」水分不小。其三没有任何一家披露现金流为正——这个赛道处在典型的「增长优先于利润」阶段。5.2 商业模式不拥有 GPU 的调度者serverless 厂商大多是「轻资产调度者」Modal 对接 13 家云供应商一年前还是 5 家Baseten 从约 20 家供应商采购RunPod 用收入分成模式整合第三方数据中心。它们的护城河不在物理容量而在调度算法、冷启动延迟RunPod FlashBoot、E2B 快照与开发者体验。与之对比上游的 CoreWeave 深度亏损FY25 每股 -$2.81、自由现金流 -$7.3BNebius 是唯一接近盈利的Q1’26 调整后 EBITDA $130M[A]。重资产承担周期风险轻资产赚取利用率价差——这是 2026 年 GPU 产业链最清晰的分工。5.3 NVIDIA既是裁判又是运动员NVIDIA 一面通过 NVCFCloud Functions与 DGX Cloud 直接下场卖 serverless 推理一面又以 $150M 投资 Baseten、参投 Fireworks 与 Together、$2B 投资 Nebius 9.3% 股权 [B]。这种「既竞争又投资」的姿态本质是在整个推理层建立影响力网络——它是这个市场事实上的 kingmaker。六、企业落地谁在生产环境真的用上了6.1 头部厂商的可验证客户Modal累计启动 10 亿 沙箱沙箱业务贡献超过 1/3 收入客户包括 DoorDash商户侧 Agent、Cognition、Decagonp90 延迟 342ms、Ramp其编码 Agent 撰写 70% 的合并 PR[A]RunPod月流水已过 $240M 年化客户含 Zillow、OpenAI、Perplexity、Civitai每月 80 万 LoRA、500 并发 GPU其《State of AI》报告显示 Qwen 已超越 Llama 成为自托管部署最多的开源模型 [A]Baseten × Hebbia面向投行的机构智能平台迁移后 token 吞吐 2.5 倍、首 token 时间快 4 倍、推理成本降低 10 倍以上Together × Washington PostAsk The Post AI 每月处理 17.9 亿输入 token、约 2 秒响应。这些数字全部是厂商发布的、未经独立审计但它们的共同信号是serverless GPU 已经有「名字级」的生产用户而不是 demo。6.2 ROI 的真实区间低流量 LoRA 特性约 200 次/天常驻约 $400/月 → serverless 约 $5/月 [C]Mistral-7B 聊天机器人$2,400/月 → $780/月-67%[C]某创业公司通过 Karpenter 按量缩容 spot把 32 台 A100 从 $75K/月压到 $39K/月-48%。6.3 采购模式的分岔2026 年企业采购明显分两派AI-native 团队用信用卡直接采购 Modal/RunPod/Together按 API 而非按基础设施合同受管制的企业要求 kernel 级隔离、数据驻留与 BYOC——这正是 E2BmicroVM和 CloudflareVPC/Zero-Trust强调合规姿态而非原始速度的原因。中间派则用 K8s Karpenter KEDA 自建 scale-to-zero把「serverless 经济学」搬回自己集群里。七、Cloudflare 与「执行层大厂化」把沙箱做成 CDN7.1 架构赌注状态与计算分离cloudflare/computer的核心设计是把「状态」和「计算」彻底分离状态放在 SQLite Durable Object 里持久化计算是「可丢弃」的一次性执行两个可互换后端共享同一文件系统——V8 isolatejust-bash把 shell 命令编译成 JS秒级启动、低内存用于日常文件/数据处理完整 Linux 容器Cloudflare Containers用于装包和任意二进制。Cloudflare 的目标是让容器只承担 Agent 工作量的不到 10%——这是一个未经实证的假设也是它最受质疑的点isolate 是语言级隔离而非硬件级隔离[D]。上图cloudflare/computer 的架构——状态放在 Durable Object 持久化计算按命令在 V8 isolate 与完整容器之间选择计算可丢弃、状态可恢复。7.2 经济模型与对 E2B/Modal 的挤压Agent 挂在 Durable Object 上休眠时计算零成本actor 模式1 万个 Agent 各活跃 1%只相当于约 100 个常驻实例。定价上Cloudflare Sandboxes 约 $0.00002/活跃 vCPU 秒按 100 万次请求约 $200/月计算对比 E2B 同类量级 $1,000 与容器热池 $2,000 [C]。配合收购来的 Replicate 模型库5 万 模型Cloudflare 正在把 Agent 基础设施的成本曲线压向「CDN 的价格」——这是对按「沙箱每秒」收费的独立厂商的商业模式威胁。7.3 反例Fly.io 承认「我们错了」Fly.io 的 GPU 业务在 2026 年 7 月 31 日被弃用。官方坦承「We Were Wrong About GPUs」大多数开发者要的不是 GPU而是 LLM API只有 L40S 找到了一点市场 [A]。这个反例极其重要——它说明「serverless GPU」的用户买的从来不是 GPU 本身而是「不用管 GPU 的推理」。当 Fly.io 转向「Computers for Agents」持久磁盘 秒级启动 VM并拿到 $25M D 轮时它其实在用另一种方式回应同一个需求。八、中国视角涨价潮、算力券与「Token 工厂」8.1 云厂商的按需 GPU 走向工程成熟阿里云函数计算FC2026 年 1 月发布 GPU「浅休眠」无请求时实例休眠而非销毁唤醒仅 500ms-2s某深圳 OCR 业务降本近 70%支持 1/8、1/4 卡虚拟化部署成本可降 90% 以上 [A]。火山引擎 2026 年 3 月商用 Serverless 上下文检索GPU 按量最低 9.16 元/时。华为云则明确不打价格战走「Agentic Infra」路线昇腾 910B 推理成本约为 H100 方案 1/3。8.2 「Token 工厂」的毛利拷问以硅基流动为代表的独立推理平台 2026 年 6 月 30 日递表港交所18C 章估值 77.4 亿元三年涨 33 倍——但 2025 年营收仅 5,533 万元、净亏 3.45 亿、毛利率转负至 -24%公有云业务低至 -119%付费客户 71.6 万家但 ARPU 仅约 22 元 [A]。这是「免费 Token 换规模」模式的代价营收爆炸、毛利为负。对比海外 Baseten 的 $600M ARR国内独立平台的商业化差距不在技术而在付费意愿与开源生态的挤压。8.3 中国没有「GPU沙箱一体」的 Modal国内 Agent 执行层走的是「兼容 E2B SDK 应用平台内嵌」路线腾讯云 CubeSandboxRustVMM microVM直接兼容 E2B SDK冷启动 P95 仅 78.3ms、PPIO首个兼容 E2B 接口的 Agent 沙箱已接入 Dify/Camel/OpenManus、阿里 OpenSandbox一套 API 对接 Docker/gVisor/Kata/Firecracker 四种引擎[B]。Dify v1.16.0 也在 2026 年 7 月首次内置完整 Linux 沙箱。独立「中国版 Modal」仍是结构性空白[D]。8.4 政策杠杆算力券贵州 2026 年计划发放 1.4 亿元算力券、补贴最高 30%算力规模从 170 增至 190 EFLOPS [A]。算力券本质是政府补贴「按需 GPU」的价格等于在给 serverless 模式的客户侧再添一把火。综合各方测算GPU 利用率 52% 是「自建 vs 按量」的盈亏平衡线而多数 AI 创业公司利用率落在 30-50%——自建反而更贵直接利好按量模式。九、判断与风险判断一冷启动战争 2026 年基本打完。快照技术让 70B 级模型冷启动进入个位数秒vLLM 正在把 CUDA Checkpoint 与 Pod Snapshot 变成一等公民。我赌 2027 年之前「冷启动多快」不再是 serverless GPU 的差异化卖点而是默认能力。判断二真正的壁垒在「执行层软件」而非 GPU。当算力变成自来水能挣钱的不是拥有水的而是控制水龙头的——调度算法、快照栈、Agent 沙箱的隔离与审计。轻资产调度者Modal/Baseten会继续蚕食重资产层的毛利空间但前提是把利用率套利做对。判断三Agent 沙箱与推理会收敛为一个市场。Modal 的沙箱收入已超 1/3、Cloudflare 用 Replicate 补模型层、Fly.io 弃 GPU 而押 Agent VM——2027 年的 serverless 计算将是「给 Agent 的机器 给模型的 GPU」的混合体。先不下结论究竟是沙箱吃掉推理Cloudflare 路线还是推理长出沙箱Modal 路线取决于 Agent 工作负载里 GPU 密集型任务的比例。判断四中国「Token 工厂」将迎来毛利大考。硅基流动的 -24% 毛利率与涨价潮叠加意味着免费补贴换规模的模式走到尽头。我原以为国内会复制海外的 ARR 神话但 2026 年的数据显示独立推理平台的商业化差距不在技术而在付费意愿。2026 Q4 可能才是国内 API 定价的底部。判断五多租户安全是下一个雷。MICRO’26 论文 GhostAccess 展示了首个无需 GPU 访问即可跨租户窃听的 GPU 侧信道——利用 CUDA Unified Memory 未文档化行为完全绕过 NVIDIA MIGMIG 只降 4.7% 信道容量在阿里云/AWS 五套硬件验证 [B]。当 serverless 把更多租户塞进同一块 GPU隔离就是合规底线也是成本项。风险清单① 供应商风险已实证Fly.io 弃 GPU、Replicate 被收购② scale-to-zero 的「幽灵账单」——自动扩缩容误配置导致 GPU 空转计费③ 冷启动虽然变快但仍在计费利用率误判会把省下的钱加倍还回去④ 大云一旦补课AWS Lambda 上 GPU独立厂商的窗口期会急剧收窄。十、关键监测指标2026 下半年Lambda IPO传闻 H2 2026$8-12B——检验市场对「非 CoreWeave」GPU 故事的胃口Fly.io 弃用 GPU 后客户去向RunPod/Modal/GCP Cloud Run与「Computers for Agents」的实际采用cloudflare/computer的生产采用与定价透明度isolate 隔离被攻击验证的事件vLLM 是否把 CUDA Checkpoint 集成进正式版以及快照成为多 GPU 部署的默认能力中国涨价潮阿里/百度/商汤/UCloud是否传导到按量 serverless 定价以及硅基流动上市进程NVIDIA 在推理层的投资网络Baseten/Fireworks/Together/Nebius是否进一步整合成「NVIDIA 云联盟」证据等级[A] 官方/一手 [B] 2可靠来源 [C] 单一来源 [D] 个人判断AI 辅助深度研究人工视角解读。每日更新。参考来源Cloudflare — cloudflare/computer 与 Replicate 收购官方博客Modal — Series C 与「真正无服务器的 GPU」官方博客 ReutersBaseten — $300M Series E官方博客Together AI — $800M Series C官方博客MarketsandMarkets — GPU-as-a-Service 市场预测Grand View Research — AI 推理市场规模RunPod — 突破 $120M ARR 与 $100M A 轮官方 TechCrunchFly.io — $25M D 轮与「We Were Wrong About GPUs」SiliconANGLE — Cloudflare 收购 Replicate$57.4M 实际对价vLLM — CUDA Checkpoint 集成提案 RFC #34303阿里云开发者 — 函数计算 GPU 浅休眠界面新闻 — 硅基流动递表港交所估值/毛利/客户数据36氪 — 算力涨价潮与 API 定价认知套利AgentCgroup — Agent 工作负载特征研究arXiv:2602.09345TheNextWeb — Together AI $800M C 轮Aramco VenturesSegmentFault — 国内 Agent 平台沙箱横评贵州省大数据局 — 2026 年算力券 1.4 亿元GitHub — Cloudflare Agents含 cloudflare/computerRuntimeWire — Hark Handoff 发布FreeBuf — GhostAccess GPU 侧信道MICRO’26

最新新闻

日新闻

周新闻

月新闻