“大脱钩”时代:CSP ASIC 的规模化扩张与 NVIDIA 利润率拐点研判
日期: 2026-05-15 职位: TMT 行业分析师 状态: 机构内部绝密研究
1. 核心观点:推理侧 ASIC 的结构性替代
截至 2026 年 5 月,AI 算力市场已进入“大脱钩”阶段。通用 GPU(如 NVIDIA Blackwell)的溢价正面临来自第二代和第三代云服务商(CSP)自研 ASIC 的严峻挑战。我们的调查确认,推理负载(目前约占数据中心 AI 总算力需求的 65%)的定价权正在向成本优化、垂直集成的自研芯片转移。这有力支撑了 NVIDIA 毛利率(目前维持在 ~75% 左右)将在 2026 年 Q3 开启实质性下修的判断。
2. CSP ASIC 研发进展:3nm 时代的垂直集成
主要超大规模云厂商已成功将其内部核心负载迁移至 3nm 自研芯片,相比 NVIDIA 的 B200/GB200 集群,在总拥有成本(TCO)上取得了显著优势。
2.1 Google: TPU 规模领先
- TPU v6 (Trillium): 已成为 Google 机群中的出货量主力,预计部署规模达 160 万颗。其单美元性能比 TPU v5p 提升了 2.5 倍。
- TPU v8 (Sunfish/Zebrafish): 2026 年 4 月最新发布,其中 v8i 版本是首款针对“智能体”优化的芯片,专门处理长文本推理和 System 2 思维模型负载,而这正是当前推理市场的核心增量。
2.2 AWS: 统一平台战略
- Trainium 3: 2026 年 Q1 已正式商用。基于 TSMC 3nm 工艺,单片提供 2.52 PFLOPS (FP8) 算力。
- 替代规模: AWS 已将 Inferentia 与 Trainium 线合并为统一的 Trainium 3 品牌。主要客户如 Anthropic 已锁定约 1GW 的自研算力容量,大幅减少了对 NVIDIA GPU 实例的依赖。
2.3 Microsoft: Maia 200 加速普及
- 部署情况: Maia 200 目前正支撑 GPT-5.2 和 Microsoft 365 Copilot 在美国中部地区的推理负载。
- 经济效益: 微软报告称,相比 B200 机群,Maia 200 的性价比提升了 30%。通过 Maia SDK(集成 OpenAI Triton)的使用,内部团队迁移出 CUDA 生态的门槛已大幅降低。
2.4 Meta: “算力主权”确立
- MTIA v3 (Iris): Meta 预计到今年年底,其 35% 的推理机群将由 MTIA 驱动。
- 工作负载迁移: 60% 的 Instagram 推荐流量和 40% 的 Llama 系列推理已迁移至 MTIA。相比 H100/B200,MTIA 带来的 44% TCO 降幅每年可为 Meta 节省数十亿美元的资本支出。
3. NVIDIA 利润率承压:成本与售价的双重挤压
NVIDIA 的利润率正受到两股力量的共同挑战
- 物料成本(BoM)上升: Blackwell 的制造复杂度(双芯片封装、CoWoS-L)以及 HBM3e 价格的飙升(目前占 COGS 的 45%)使得单片成本推高至 ~$6,400。
- 推理侧定价权丧失: 随着 CSP 将最高容量的负载(推理)转入自研 ASIC,NVIDIA 被迫在剩余的“算力租赁”市场中进行价格竞争。过去 6 周内,H100/H200 的租赁价格下跌了 26% 便是明证。
| 指标 | 2024 高点 (Hopper) | 2026 当前 (Blackwell) | 2026 Q3 预测 |
|---|---|---|---|
| NVIDIA 毛利率 | 78.2% | 75.1% | 72.8% - 73.5% |
| HBM 成本占比 (COGS) | 35% | 45% | 48% (向 HBM4 过渡) |
| 推理市场占比 (ASIC vs GPU) | <15% | ~35% | >45% |
4. 结论与验证
2026 年 Q3 利润率下修的逻辑具备充分的产业基础。虽然 NVIDIA 仍是万亿参数级“拓荒模型”训练的金标准,但推理这一“现金奶牛”市场向 CSP ASIC 的流失已不可逆。所谓“大脱钩”,意味着随着 AI 应用的普及,NVIDIA 的收入将越来越依赖于份额较小的训练市场,而体量巨大的推理市场将演变为专用芯片的红海竞争。
结论: 我们支持首席策略师关于 2026Q3 开启利润增速预期下修的观点。
TMT 行业分析师 2026-05-15