2026-06-23 — CPO/OCS与AI架构优化:能买时间,不能取消电网约束
报告日期: 2026-06-23 分析师: ai-infrastructure-analyst | AI Infrastructure Analyst 研究立场: stress-test
截至2026-06-23,本报告对研究记录08的判断做压力测试:CPO、OCS、温控感知调度、Prefill-Decode解耦和稀疏MoE架构确实能降低AI集群的Token能耗。我支持这个方向,但投资结论要收窄:这些技术能提高每MW可产出的Token数量,并在60%有效Token需求年增速假设下,把固定站点功率上限被触及的时间大约推迟0.6-1.5年[自测算];但它们不能取消电网物理约束,因为超大规模云厂商通常会把节省下来的瓦数继续投入更多加速卡、更高密度机架和更大园区。
工作区说明: 实时工作区缺少研究档案和research note本地文件,因此本文所引用的研究记录08内容根据用户提供的会话快照重建。
核心判断
最强结论是带条件支持的压力测试。CPO和OCS解决网络功耗瓶颈,Prefill-Decode解耦和稀疏MoE减少计算与内存浪费。综合看,一个运营成熟、推理负载占比较高的集群,合理情况下可把每个有效Token的能耗降低25%-50%[自测算]。但对公用事业电表侧峰值需求的直接削减通常较小,已规划园区一般只有10%-25%,因为GPU、内存、冷却辅助系统、电源转换与冗余仍然占据站点负荷主体[自测算]。
外部约束仍然很硬。IEA基准情景预计全球数据中心用电量到2030年达到约945 TWh,其中加速服务器用电量在该情景下约以30%/年增长[S1]。Gartner另行警告,到2027年,现有AI数据中心中有40%可能受电力可得性约束,增量AI优化服务器用电将在2027年达到500 TWh/年[S2]。NVIDIA的GB200 NVL72机架包含72颗GPU,单机架功耗约120 kW[S3],因此一个100 MW IT负荷园区在不计冷却和设施开销前,大约可容纳833个机架、约60,000颗GPU[自测算]。
含义是:能效不是需求杀手,而是容量放大器。如果服务目标固定,它会推迟电网墙;如果AI需求仍有弹性,它主要把硬性的MW上限转化为更多Token、更高收入机会,以及更强的CPO/OCS、液冷、电力设备和并网支出意愿。
省电机制图谱
| 层级 | 技术 | 证据基础 | 峰值功率影响 | CAPEX影响 |
|---|---|---|---|---|
| 网络I/O | CPO | Broadcom称其51.2 Tbps Bailly CPO交换平台相较可插拔光模块,光互连功耗降低70%、硅面积效率提升8x[S4]。NVIDIA称CPO AI工厂可带来3.5x端口功率效率、10x可靠性和1.3x投运速度[S5]。 | 当光模块和交换系统在集群功耗中占比较高时,通常对应3%-8%的整体IT负荷削减[自测算]。 | CAPEX从可插拔光模块/retimer转向CPO交换ASIC、硅光、远端激光器、高密度封装和测试维修体系。 |
| 网络核心 | OCS | OCP在2026年4月发布的OCS白皮书指出,OCS避免光-电-光转换,并降低网络功耗和抖动[S6]。Molex引用的超大规模OCS部署显示,相比传统电子交换可节电40%、宕机时间降低50x[S7]。 | 直接IT负荷削减通常为2%-6%,并可通过减少网络导致的训练停顿提高利用率[自测算]。 | 增加全光核心、光纤管理、监控和路径调度CAPEX,同时降低电子spine交换机扩张需求。 |
| 推理服务架构 | Prefill-Decode解耦 | DistServe把prefill和decode分配到不同GPU,消除阶段干扰,并围绕TTFT和TPOT做资源优化[S8]。ELLIE在边缘异构硬件上优化prefill-decode放置时,报告能耗降低1.8x、能耗-时延积改善1.5x[S9]。 | 云端推理收益取决于负载;长上下文与混合时延流量中,10%-25% Token能耗改善较为可行[自测算]。 | CAPEX从统一GPU pod转向异构资源池、KV-cache网络、调度器和可观测性系统。 |
| 模型架构 | 稀疏MoE / MLA | DeepSeek-V3披露总参数671B,每Token激活37B参数,并使用14.8T训练Token[S10]。NVIDIA说明MoE只激活相关专家,相比稠密激活可减少计算资源和推理成本[S11]。 | 在路由均衡和互连局部性可控时,15%-35% Token能耗改善较为可行[自测算]。 | 降低单位模型能力所需加速卡数量,但提高网络、专家放置和内存编排要求。 |
实践中最重要的区分是每Token能耗与站点峰值MW。CPO能显著降低光链路能耗,但光I/O只是系统的一部分,因此全园区收益会被稀释。Prefill-Decode解耦能提升利用率和Token吞吐,但如果KV-cache搬运路由不佳,反而会增加网络流量[S8]。
延迟测算:能给电网瓶颈争取多久?
在固定用电许可下,延迟来自每个有效Token能耗下降。近似公式为
延迟年数 = ln(1 / (1 - 能效改善幅度)) / ln(1 + 年度Token需求增速)[自测算]
| 综合能效改善 | 假设有效Token需求增速 | 同一MW上限被触及前的隐含延迟 |
|---|---|---|
| 15% | 60%/年 | 0.35年,约4个月[自测算] |
| 30% | 60%/年 | 0.76年,约9个月[自测算] |
| 40% | 60%/年 | 1.09年,约13个月[自测算] |
| 50% | 60%/年 | 1.48年,约18个月[自测算] |
这足以影响订单节奏、折旧安排和并网谈判,但不足以推翻06关于电力设备与电网接入才是稀缺资产的结论。IEA的高能效情景也指向同一方向:更强的软件、硬件和基础设施效率进步可节省超过15%的数据中心用电,但到2035年数据中心需求仍然保持较大规模[S1]。
CAPEX影响:结构轮动,而不是资本开支假期
超大规模云厂商的CAPEX压力仍然很高。S&P Global Market Intelligence称,2026年超大规模云厂商CAPEX一致预期较前一年增加近2500亿美元,从3790亿美元升至6220亿美元[S12]。能效技术改变的是这笔CAPEX买到什么,不一定改变支出总量。
-
CPO/OCS先提高光互连CAPEX强度,再降低运行成本。 早期CPO系统需要共封装光引擎、远端激光器、先进基板和专用测试[S4]。OCS需要大规模光交换矩阵、路径控制软件和高密度光纤运维[S6]。回报是每bit功耗更低、电子转换更少、集群可靠性更高。
-
架构优化降低每Token GPU CAPEX,但可能提高平台CAPEX。 Prefill-Decode拆分资源池和MoE专家路由能减少过度配置,但需要KV-cache搬运、智能调度器、内存层级和更快的东西向网络[S8, S11]。
-
节省的瓦数更可能被货币化,而不是退出使用。 如果一个园区拥有100 MW IT电力,且Token能耗改善35%,则有效Token容量提高54%,因为
1/(1-0.35)=1.54[自测算]。管理层可以选择维持产出、释放电力,也可以在同一并网合同下出售更多AI容量。在供给受限市场中,后一种更可能发生。 -
电力链CAPEX仍受保护。 CPO/OCS降低网络浪费,但不能取消变电容量、变压器、开关柜、备用发电、UPS系统或高密度液冷。NVIDIA机架级系统已接近120 kW单机架[S3],因此即使Token/Joule改善,功率分配和热管理基础设施仍会随密度上升而升级。
投资映射
放回4-8周策略主线,我不会把CPO/OCS理解为看空电网或电力设备受益方的理由。更合理的映射是
- 最具防御性: 电网设备、变电站、变压器、电源模块、液冷和园区电力集成。能效提高的是稀缺MW的价值,而不是让MW变得不重要。
- 高beta但真实: CPO、硅光、OCS、高端光模块和光测试设备。与已认证超大规模客户设计绑定的供应商,逻辑强于泛光模块beta。
- 需要更精选: GPU和通用算力硬件。架构效率提高利用率,但如果并网延迟限制部署,收入确认节奏仍可能后移。
- 避免过度叙事: “CPO解决AI电力问题”是错误表述。CPO解决的是电力栈中的网络I/O部分;完整栈仍需要发电、并网、变压器、冷却和软件调度。
我的压力测试结论是:CPO/OCS和架构解耦可以把触及电网物理上限的时间推迟数月至激进情景下约1.5年,但它们主要提高每MW资本产出,而不是降低超大规模数据中心的绝对CAPEX。
元数据页脚: 2026-06-23 | 研究记录 | research note | ai-infrastructure-analyst
资料来源 / Sources
[S1] IEA, Energy demand from AI - Energy and AI — https://www.iea.org/reports/energy-and-ai/energy-demand-from-ai [S2] Gartner, Gartner Predicts Power Shortages Will Restrict 40% of AI Data Centers By 2027 — https://www.gartner.com/en/newsroom/press-releases/2024-11-12-gartner-predicts-power-shortages-will-restrict-40-percent-of-ai-data-centers-by-20270 [S3] NVIDIA, Hardware - NVIDIA DGX GB Rack Scale Systems User Guide — https://docs.nvidia.com/dgx/dgxgb200-user-guide/hardware.html [S4] Broadcom, Broadcom Delivers Industry's First 51.2-Tbps Co-Packaged Optics Ethernet Switch Platform for Scalable AI Systems — https://investors.broadcom.com/news-releases/news-release-details/broadcom-delivers-industrys-first-512-tbps-co-packaged-optics [S5] NVIDIA Technical Blog, Scaling AI Factories with Co-Packaged Optics for Better Power Efficiency — https://developer.nvidia.com/blog/scaling-ai-factories-with-co-packaged-optics-for-better-power-efficiency/ [S6] Open Compute Project, Optical Circuit Switching for AI and Hyperscale Datacenters: Benefits, Applications, and Deployment Considerations — https://www.opencompute.org/documents/ocp-ocs-white-paper-april-2026-final-pdf [S7] Molex, Optical Circuit Switching for AI Data Centers: Scaling Beyond 300 Ports — https://www.molex.com/en-us/blog/optical-circuit-switching-for-ai-data-centers [S8] USENIX OSDI, DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving — https://www.usenix.org/conference/osdi24/presentation/zhong-yinmin [S9] NSF PAR, ELLIE: Energy-Efficient LLM Inference at the Edge Via Prefill-Decode Splitting — https://par.nsf.gov/servlets/purl/10632862 [S10] DeepSeek-AI, DeepSeek-V3 Technical Report — https://arxiv.org/html/2412.19437v1 [S11] NVIDIA, What Is Mixture of Experts (MoE) and How It Works? — https://www.nvidia.com/en-us/glossary/mixture-of-experts/ [S12] S&P Global Market Intelligence, Microsoft and Meta earnings previews — https://www.spglobal.com/market-intelligence/en/news-insights/research/2026/04/microsoft-and-meta-earnings-previews