AI基础设施与算力成本的降级压力:云服务商在2026年下半年的资本支出(CapEx)逻辑重塑
作者: TMT行业分析师 (TMT Analyst) 日期: 2026-05-25 研究 ID: [source-id-redacted] 研究记录序号: 02/08 当前立场: 支持 (Support)
一、 核心观点与摘要
截至 2026-05-25,全球AI基础设施投资领域正在经历一场深刻的结构性范式转移。我们强烈 支持 以下核心判断:DeepSeek R1 引发的 API Token 极致价格战 与 Claude 在企业端的史诗级盈利突破,正双轮驱动重塑全球主流云服务商(CSP—AWS、Azure、GCP)在2026年下半年的资本支出(CapEx)逻辑。
- 范式转向: 云厂商盲目、 speculative(投机性)采购并构建超大规模训练集群的“军备竞赛”时代已进入尾声。在API单价极致压缩的现实下,云厂商的 CapEx 优先级正在从投机性的“前沿模型训练算力”全面转向 以投资回报率(ROI)为导向的密集推理时算力(System 2)、自研定制化芯片(ASICs)的快速扩产以及利润率保卫战。
- 双轮催化逻辑: 尽管以 DeepSeek R1 为代表的推理模型使 API 价格崩塌了约 96% [S1],给纯计算资源毛利率带来了巨大压力;但以 Anthropic 旗下 Claude 在企业端实现年化营收运营率达 300 亿美元的盈利突破 [S2] 为契机,“杰文斯悖论(Jevons' Paradox)” 被成功触发——通缩性的定价机制大幅降低了企业端使用门槛,从而带来了 Agent(智能体)和测试时推理(Test-Time Compute)工作负载呈几何级数的指数增长。这使得云服务商的 CapEx 总额仍保持在历史最高水平,但其内部的投资构成和逻辑已发生根本性裂变。
二、 催化剂一:DeepSeek R1 与 Token 层的极致通缩
DeepSeek R1 的崛起彻底打破了“只有依靠成倍堆砌高昂训练集群才能获得前沿智能”的传统叙事。
1. 极致价格战的现实
DeepSeek R1 官方 API 价格为 每100万输入 Token 0.55美元(缓存未命中)以及 每100万输出 Token 2.19美元。相比于 OpenAI o1 模型的每100万输入 15.00美元 和每100万输出 60.00美元,实现了高达 96.3% 的断崖式降价 [S1]。
2. 向“System 2 推理时算力”的系统性重构
DeepSeek R1 的高效率证明了强化学习和“测试时算力(Test-Time Compute)”能够在很大程度上替代庞大的一次性训练算力支出 * 算力消耗从离线预训练阶段(高风险、高昂的固定资产 CapEx)转移到了在线推理执行阶段(与真实查询和收入挂钩的可变 CapEx/OpEx)。 * 模型能够根据任务的复杂度动态延长“思考时间”,使算力消耗直接与企业用户的商业价值相匹配。
[!NOTE] 这一技术路径的变迁,意味着云服务商无需再盲目地在客户需求产生前去 speculative(投机性)堆积上百万张 GPU 训练集群,而是可以实现以真实推理负荷为导向的“即时、按需”扩产(Just-in-Time CapEx)。
三、 催化剂二:Claude 企业端的盈利突破与真实需求拉动
如果说 DeepSeek R1 从底层将价格打了下来,那么 Anthropic 的 Claude 则在顶层拉动了真实的商业化变现,验证了企业对高可靠性、具备 Agent 复杂执行能力模型的强大付费意愿。
1. 百亿美元级营收的商业化大考
正如 research note 分析所述,Claude 在企业端的年化营收运营率已飙升至 300 亿美元 [S2]。这一规模标志着生成式 AI 落地已跨越非生产性试验,进入深度业务系统集成的深水区 * 企业级支出正从“体验性 Pilot”全面转向“核心生产系统整合”(如自动代码编写、金融深度分析、法律条款合规审查)。 * 这些智能体(Agent)工作流具有极高的“Token 吞吐饥渴感”。一个复杂的 Agent 闭环任务可能会在后台调用数百万个推理 Token,直接转化为云服务商基础设施上的海量、持续的计算负荷。
2. 从投机性投资转向高能见度“合同绑定”
各云厂商的算力扩产逻辑正迅速告别盲目扩张,转向“营收绑定(Revenue-backed)”。如今,云厂商只有在锁定大型企业长期云服务合同,或有深度战略绑定伙伴(如 AWS 与 Anthropic 达成的数百亿美元算力与模型深度合作协议)的前提下,才会大规模追加专用算力集群 CapEx。
四、 杰文斯悖论:为何总 CapEx 维持高位但内部结构发生重组
直观来看,Token 价格断崖式下跌 96% 似乎会打击云基础设施的需求。然而,根据经典经济学中的 “杰文斯悖论(Jevons' Paradox)”,当某种资源的利用效率提高、成本显著下降时,该资源的整体消耗量反而会因为门槛骤降而呈指数级飙升。
graph TD
A[DeepSeek R1 与价格战: Token 成本断崖下跌 96%] --> B[企业端使用门槛与开发壁垒降至冰点]
B --> C[大规模智能体 Agent 及推理时算力系统走向商用]
C --> D[Token 整体调用消耗量呈指数级暴增]
D --> E[杰文斯悖论生效: 算力总吞吐需求不降反升]
E --> F[云服务商总 CapEx 依然维持在历史最高区间]
F --> G[CapEx 内部调配重组: 密集推理与自研 ASICs]
1. 2026年云厂商 CapEx 指引数据
受算力总吞吐量爆发的拉动,2026年“三巨头”云厂商的资本支出指引仍然维持在史诗级的高位 * Amazon (AWS): 约 2000 亿美元以上 [S3] * Alphabet (Google): 约 1750 亿 – 1850 亿美元 [S3] * Microsoft (Azure): 约 1100 亿 – 1900 亿美元 [S3]
2. CapEx 内部结构调整
虽然整体支出大数依然强劲,但在2026年下半年,CapEx 的内部投资方向正在发生翻天覆地的转变
| 资本支出维度 | 旧逻辑 (2026年前) | 新逻辑 (2026年下半年) |
|---|---|---|
| 计算类型偏好 | 训练为主 (超大规模 GPU 互联训练集群) | 推理为主 (面向测试时算力的密集型高带宽推理节点) |
| 芯片选型路线 | 100% 采购昂贵 NVIDIA GPU (H100/B200/GB200) | 分叉化路线:自研 ASIC 承担通用推理;高端 GPU 仅用于极前沿训练 |
| 投资容忍度 | 投机性买卡 (抢先屯卡以建立所谓的先发壁垒) | 收入背书的即时扩产 (根据企业实际 ARR 及流量锁定采购) |
| 网络与架构设计 | 单一机房内极致追求超低延迟的训练网络 | 跨区域分布式部署 Edge-Inference 节点,追求高内存带宽 |
五、 毛利保卫战:自研芯片 ASICs 替代的全面加速
在2026年下半年的市场环境下,云服务商(CSP)面临的最大财务痛点在于:API 极致通缩的背景下,硬件厂商(NVIDIA)极高的利润分成榨干了云厂商的利润空间。如果一味采购溢价过高的第三方 GPU,云服务商在 Token 通缩战中将无利可图。
1. 自研定制化芯片(ASICs)的毛利护城河
为了确保整体算力运营毛利率,云厂商正以空前的力度将其 CapEx 转移至 proprietary( proprietary)定制芯片 * AWS Trainium/Inferentia: 依托 AWS Neuron SDK,将开源推理架构(如 DeepSeek R1 及其衍生蒸馏模型)轻松编译并部署于自研芯片上 [S4]。 * Google TPU (v6e/v7e): 借助 JAX/XLA 框架进行深度算力资源优化,利用高性价比 TPU 承载大面积的推理管线。 * Microsoft Maia: 快速扩大自主芯片规模,稀释 Azure OpenAI 中通用逻辑计算部分的买卡成本。 * 财务硬账本: 运行开源和推理型大模型时,自研 custom ASICs 比起采购高溢价的第三方 GPU 算力实例,可帮助 CSP 降低约 50% 至 70% 的单位推理成本 [S5],这成为了云服务商在价格战中维持良性财务运转的核心生命线。
2. 硬件采购“双轨制”
这在 CapEx 指引中催生了泾渭分明的采购双轨制 1. 前沿模型训练轨(高溢价高壁垒): 仅采购满足最顶级前沿基座大模型(如 Claude 4、o3)训练所必需的 NVIDIA GB200 系统,严格控制总体比重。 2. 通用算力推理轨(自研 ASIC 主导): 极速扩容低成本的自研芯片(TPU/Trainium 等)基础设施,用以支撑广泛的开源模型服务、日常企业 Agent 闭环任务和蒸馏推理工作负载,实现 ROI 最大化。
六、 战略结论与下阶段hand-off推荐
DeepSeek R1 的极致价格通缩与 Claude 的企业级盈利突破,共同将 AI 基础设施的逻辑从“科幻式泡沫投机”拉回了“高效低本的云公用事业扩张”。AWS、Azure、GCP 在2026年下半年的 CapEx 重塑,充分表明了自研芯片替代和推理成本优化的战略必要性。
为进一步剖析这一范式转移下的跨大类资产与宏观投资策略——特别是全球多资产配置框架在硬件(半导体设备)、软件/云服务厂商及主权防守资产之间,如何在全新 CapEx 周期下进行仓位重组与主权风险溢价重估,我们建议将下一阶段的研究记录交给 大类资产配置师 (asset-allocator)。
资料来源 / Sources
- [S1] Notta AI, "DeepSeek R1 API pricing comparison OpenAI o1" — https://www.notta.ai/en/blog/deepseek-r1-api-pricing-comparison
- [S2] 研究记录 research note report, "Thematic Researcher's AI Market Share Analysis" — 本地来源归档 discussion/ee0b8051-34d5-4488-9fc3-111607be4eb7/research note/report.en.md (Reconstructed from board context)
- [S3] Futurum Group & Substack tech analysts, "2026 Hyperscaler Capital Expenditures Forecast" — https://vertexaisearch.cloud.google.com/grounding-api-redirect/AUZIYQFlNRlm_iWEFSkBkPIhPrN9L5Fk303hC3ekN60bUa80bvC30TS3nqxmD12n2mi0B4hbeY9RQiiqRwRQZi26VM-gl4h5se7XEE-2RPl04dSjNpMMfRZJSwKZFgMi7-kHgd4QnnVBqs8Zs-znFPpbRvob4_B76G9uYER-yFNsBHZZMDiPDZuVfAdIo_g=
- [S4] AWS Official Documentation, "Optimizing Open-Source Models via AWS Neuron SDK and EC2 Trainium/Inferentia Instances" — https://aws.amazon.com/ec2/instance-types/trn1/
- [S5] Tom's Hardware, "Hyperscaler Custom Silicon vs NVIDIA GPUs cost-performance comparison in 2026" — https://www.tomshardware.com/tech-industry/artificial-intelligence/custom-silicon-ai-cost-savings