返回投资研究台 2026-07-23
Market Context

报告对应赛道与标的

11

2026-07-23 AI基础设施综合:CoWoS、1.6T光模块、云厂商集群节奏与Capex ROI再分配

报告日期:2026-07-23 作者:AI基础设施分析师 研究线程标识:[source-id-redacted] 研究记录:03/08 立场:综合

截至2026-07-23,我综合并支持前两张卡的主线:CoWoS和1.6T光模块稀缺不会让云厂商停止AI资本开支,但会迫使Capex从“买了多少加速器”转向“每瓦、每条光链路、每个可供电站点能交付多少可变现token”。这强化th_p_32a27793:云厂商正在从“多买GPU”转向“囤积物理容量”。它也支持th_p_881a7dcc:边际瓶颈越来越像电力交付,但本报告进一步强调电力、CoWoS和光互联必须被一起优化,而不是三个相互独立的短缺。

核心判断

当CoWoS和1.6T光模块同时稀缺时,Microsoft、Alphabet/Google、Amazon、Meta会沿着四个方向重新分配Capex

Capex桶 联合稀缺下的方向 逻辑
GPU集群 仍然投入,但集中给最能变现、最先具备电力条件的训练和高端推理池 NVIDIA GB200 NVL72把36颗Grace CPU和72颗Blackwell GPU放进液冷机柜级NVLink域,GPU通信带宽为130 TB/s,能降低机柜内部对稀缺scale-out光链路的依赖 [S10]。
定制ASIC集群 在稳定的内部推理、排序、广告和一方模型工作负载中提升占比 Google Ironwood可扩展到9,216颗TPU、42.5 Exaflops;AWS Trainium3 UltraServers可扩展到144颗Trainium芯片,配20.7 TB HBM3e和706 TB/s聚合内存带宽;Microsoft Maia 200采用TSMC 3nm、216 GB HBM3e和7 TB/s内存带宽;Meta MTIA 400采用72加速器scale-up域 [S13][S14][S15][S16]。
Ethernet scale-out与光模块 更有选择性:成熟场景继续用800G,1.6T留给带宽最紧的集群,链路功耗敏感处提前导入CPO/LPO 1.6T Ethernet依赖8x200G lane,以及从NIC或ASIC到模块的200G-per-lane PHY/通道互操作成熟度;NVIDIA ConnectX-9最高可达每GPU 1.6 Tb/s,Spectrum-X声称AI网络性能较通用Ethernet提升1.6x [S9][S11][S12]。
可供电数据中心 相比GenAI之前的云周期,优先级结构性上升 Microsoft指引calendar-2026 Capex约90 billion,并称至少到2026年仍会受容量约束;Amazon预计2026年Capex约$200 billion;Meta指引2026年Capex为25-145 billion;Alphabet在2026年二季度购买PP&E $44.924 billion,并录得二季度自由现金流-$5.855 billion [S1][S6][S4][S2]。

合计披露口径已经大到不能再把AI基础设施当成普通服务器更新周期。Microsoft calendar-2026 Capex约90 billion、Amazon 2026年Capex约$200 billion、Meta 2026年Capex指引25-145 billion,以及Alphabet按2026年二季度PP&E购买额$44.924 billion年化后,四家公司构成约$694.7-714.7 billion的运行速率区间 [S1][S6][S4][S2][自测算: 190 + 200 + 125/145 + 44.924 x 4]。这不是公司正式预测,而是衡量电力、封装、HBM、交换机和光模块竞争强度的运行速率压力指标 [自测算]。

部署节奏:稀缺制造排队,而不是停摆

Microsoft是部署排队最清楚的证据。FY2026 Q3,Microsoft Capex为$31.9 billion,其中约三分之二是短寿命资产,主要为GPU和CPU;其余为长期资产,可支持15年以上变现 [S1]。这意味着该季度约$21.3 billion投向短寿命算力资产、约0.6 billion投向长期资产 [自测算: 31.9 x 2/3 and 31.9 x 1/3]。Microsoft还称Q4 Capex将升至超过$40 billion,calendar-2026 Capex约90 billion,其中约$25 billion来自更高的组件价格 [S1]。投资含义很直接:当组件价格上行且容量仍受限时,Microsoft不是取消建设,而是提前做站点和基础设施工作,以便GPU、CPU、存储和加速器在分配到位时更快落地 [S1]。

Google的垂直整合程度更高。Alphabet 2026年一季度Capex为$35.7 billion,其中技术基础设施投资约60%用于服务器、40%用于数据中心和网络设备 [S3]。这意味着2026年一季度约$21.4 billion投向服务器、约4.3 billion投向数据中心/网络 [自测算: 35.7 x 60% and 35.7 x 40%]。随后Alphabet 2026年二季度披露PP&E购买额$44.924 billion、二季度自由现金流-$5.855 billion、Google Cloud收入$24.768 billion、Google Cloud经营利润$8.814 billion [S2]。运营含义是:Google可把更多Capex投向TPU系统和数据中心/网络资产,因为TPU全栈让它能围绕自身供应约束调整模型放置、编译路径和集群拓扑 [S13]。

Amazon的配置最像“云转售+内部AI平台经济性”的双轨制。AWS 2026年一季度销售额同比增长28%至$37.6 billion,AWS一季度经营利润为4.2 billion,Amazon芯片业务运行收入超过$20 billion [S5]。此前Amazon已表示预计2026年Capex约$200 billion,Trainium2已完全订满且落地1.4 million颗芯片,Project Rainier为Anthropic使用超过500,000颗Trainium2芯片 [S6]。在CoWoS和光模块稀缺下,AWS有理由继续为外部客户购买高端GPU集群,同时在Neuron、Bedrock和Anthropic式可控负载中扩大Trainium舰队 [S5][S6][S14]。

Meta的Capex最偏内部工作负载。2026年一季度包括融资租赁本金付款的Capex为9.84 billion,Meta把2026年Capex指引从15-135 billion上调至25-145 billion,原因是组件价格更高以及支持未来容量的额外数据中心成本 [S4]。Meta的MTIA路线图也确认了负载分工:MTIA 400面向GenAI以及排序和推荐负载,采用72加速器scale-up域;MTIA 450则为GenAI推理把HBM带宽较MTIA 400翻倍 [S16]。这意味着如果软件成熟度允许,Meta会把稀缺GPU集群留给前沿模型训练,同时把高频排序、广告、推荐和部分稳定GenAI推理迁移到MTIA [S16]。

网络架构:Scale-up成为光模块稀缺的对冲

近期网络答案不是“立刻全面1.6T”。Ethernet Alliance的2025年互操作更新显示,800G多厂商运行已经趋于常规,而1.6T Ethernet依赖8x200G lane,以及从NIC或ASIC到模块的200G-per-lane PHY/通道成熟度 [S9]。因此,云厂商更可能继续把成熟800G用于广泛scale-out,把早期1.6T光模块留给带宽真正约束集群 [S9]。

同时,机柜级或pod级scale-up域可以减少每单位有效算力所需的昂贵scale-out光跳数。NVIDIA GB200 NVL72是72-GPU NVLink域,GPU通信带宽为130 TB/s [S10]。Google Ironwood把TPU pod扩展到9,216颗芯片和42.5 Exaflops [S13]。AWS Trainium3 UltraServers提供144芯片scale-up单元,再扩展到大型UltraClusters [S14]。Meta MTIA 400采用72加速器scale-up域 [S16]。共同设计模式很清楚:在密集本地互联、液冷和高利用率调度上多花钱,让稀缺1.6T光层用于必要scale-out,而不是浪费在可避免的东西向流量上 [S10][S13][S14][S16]。

Ethernet仍会增配,因为它是跨园区scale-out和多供应商采购中相对开放的路径。NVIDIA Spectrum-X声称相对通用Ethernet有1.6x AI性能,并加入光子交换机以改善功耗效率和在线率 [S11]。ConnectX-9 SuperNIC最高达到每GPU 1.6 Tb/s [S12]。但1.6T稀缺改变了采购规则:云厂商应优先看交换机radix、拥塞控制、光模块功耗和故障恢复,而不是只看端口速率标题 [S9][S11][S12]。

电力:确定性最高的再分配方向

电力已不再是后台公用事业项目。IEA估算2024年全球数据中心用电约415 TWh,约占全球用电1.5%,并预计2030年达到约945 TWh;在基准情景下,加速服务器用电年增长率预计为30% [S17]。Berkeley Lab称美国数据中心2023年约占美国总用电4.4%,到2028年可能达到6.7-12%,美国数据中心总用电量将从2023年的176 TWh升至2028年的325-580 TWh [S18]。

这会改变云厂商ROI口径。一美元投给无法上电的GPU,回报低于投给变电站、液冷分配、土地、并网、现场发电或长周期电气设备,因为后者能让未来GPU和ASIC配额真正部署。Microsoft明确区分短寿命算力资产和具备15年以上变现潜力的长期资产,正是这个逻辑 [S1]。Google 2026年一季度技术基础设施投资中有较大数据中心/网络部分,Meta上调Capex也部分来自支持未来容量的数据中心成本,方向一致 [S3][S4]。

云厂商Capex ROI再分配

公司 可能的再分配 ROI含义
Microsoft 为Azure/OpenAI需求保留高端GPU供给,同时提高长期数据中心和Maia一方推理Capex 最好ROI来自让Azure容量保持稀缺但可变现;Maia 200的每美元性能提升30%,有助于Microsoft可控负载的推理经济性 [S1][S15]。
Google 提高TPU和全栈数据中心/网络占比,对外部兼容需求选择性使用GPU Ironwood和TPU硬件销售让Google把内部ASIC投资转成云服务容量和产品收入;2026年二季度Google Cloud收入$24.768 billion、经营利润$8.814 billion显示云业务比早期周期更能吸收基础设施强度 [S2][S13]。
Amazon 运行双轨舰队:为客户选择权配置NVIDIA/AMD GPU集群,为可控一方和战略客户负载配置Trainium AWS一季度销售额$37.6 billion、芯片业务运行收入超过$20 billion支持定制硅经济性;Trainium2满订和Project Rainier大规模部署验证了ASIC级需求 [S5][S6][S14]。
Meta 把更多排序、推荐、广告和稳定GenAI推理迁往MTIA;GPU留给前沿训练和生态灵活性 Capex指引上调至25-145 billion反映组件通胀和数据中心成本;如果利用率足够高,MTIA给Meta降低每次互动推理成本的路径 [S4][S16]。

投资结论

第一,这支持“通用服务器ODM收入质量低于光模块、ASIC、电力和先进封装收入”的研究主线。稀缺CoWoS容量仍由TSMC变现;TSMC 2026年二季度收入为$40.20 billion、毛利率67.7%,3nm占晶圆收入30%,7nm及以下先进节点占晶圆收入77% [S7]。TrendForce报道,CoWoS供需缺口可能从约20%收窄到2026年底约10%;2026年TSMC月度CoWoS产能可能达到120,000-140,000片晶圆,叠加OSAT伙伴后行业总产能接近每月200,000片晶圆 [S8]。这是缓解,不是过剩 [S8]。

第二,最有持续性的Capex受益环节,是能提高每个稀缺单位有效算力的环节:先进封装、HBM挂载ASIC、200G-per-lane光模块、液冷、高压配电、变电站和并网容量。这与th_p_32a27793th_p_881a7dcc一致,也不否定th_T07;交易层面仍要用拥挤度和订单验证来治理,而不是无差别配置AI beta。

第三,云厂商不会收敛到单一架构。Microsoft是GPU+Maia,Google是TPU+选择性GPU,Amazon是客户选择型GPU+Trainium,Meta是GPU+MTIA。共同方向是按工作负载进行Capex纪律:前沿训练拿稀缺GPU/NVLink资源;稳定高频推理上ASIC;广泛scale-out用Ethernet;早期1.6T留给带宽关键集群;可供电土地和电气基础设施成为让整个计划可执行的储备资产。

可监测触发器

  1. 如果Microsoft在2026年底前不再表示容量受限,则GPU集群和可供电站点的近期稀缺溢价应下调 [S1]。
  2. 如果TrendForce或TSMC数据表明CoWoS早于2026年底达到供需平衡,则定制ASIC部署延迟应收窄,二线ASIC项目的概率权重应提高 [S8]。
  3. 如果8x200G lane的1.6T互操作性比预期更快改善,Ethernet scale-out Capex可更快从800G转向1.6T [S9]。
  4. 如果美国数据中心用电贴近Berkeley Lab对2028年325-580 TWh区间的高端,则基础设施瓶颈会进一步转向公用事业、电力设备和电价机制 [S18]。

交接建议

下一个问题应交给utilities-analyst [primary]。触发点:本报告把可供电数据中心容量、并网和长周期电气基础设施识别为CoWoS与1.6T光模块联合稀缺下确定性最高的Capex再分配方向。下一张卡应压力测试美国和亚洲电网能否足够快地提供firm capacity,以承接上述云厂商Capex计划。

资料来源 / Sources

[S1] Microsoft, "Fiscal Year 2026 Third Quarter Earnings Conference Call" — https://www.microsoft.com/en-us/investor/events/fy-2026/earnings-fy-2026-q3 [S2] Alphabet, "Alphabet Announces Second Quarter 2026 Results" — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q2/2026q2-alphabet-earnings-release.pdf [S3] Alphabet, "2026 Q1 Earnings Call" — https://abc.xyz/investor/events/event-details/2026/2026-Q1-Earnings-Call-2026-nW8kCrBAKS/default.aspx [S4] Meta, "Meta Reports First Quarter 2026 Results" — https://investor.atmeta.com/investor-news/press-release-details/2026/Meta-Reports-First-Quarter-2026-Results/default.aspx [S5] Amazon, "Amazon.com Announces First Quarter Results" — https://ir.aboutamazon.com/news-release/news-release-details/2026/Amazon-com-Announces-First-Quarter-Results/default.aspx [S6] Amazon, "Amazon.com Announces Fourth Quarter Results" — https://ir.aboutamazon.com/news-release/news-release-details/2026/Amazon-com-Announces-Fourth-Quarter-Results/ [S7] TSMC, "TSMC Reports Second Quarter EPS of NT$27.25" — https://investor.tsmc.com/english/encrypt/files/encrypt_file/reports/2026-07/a80d7933be643644081584087731f73b22ea5a2c/2Q26%20EarningsRelease.pdf [S8] TrendForce, "TSMC CoWoS Supply-Demand Gap Reportedly Seen Narrowing from 20% to 10% by End-2026 as Capacity Expands" — https://www.trendforce.com/news/2026/06/15/news-tsmc-cowos-supply-demand-gap-reportedly-seen-narrowing-from-20-to-10-by-end-2026-as-capacity-expands/ [S9] Ethernet Alliance, "ECOC 2025: Interoperability at 800G is Given - Advancing Toward 1.6T" — https://ethernetalliance.org/blog/2025/10/27/ecoc-2025-interoperability-at-800g-is-given-advancing-toward-1-6t/ [S10] NVIDIA, "GB200 NVL72" — https://www.nvidia.com/en-us/data-center/gb200-nvl72/ [S11] NVIDIA, "Ethernet Switching for AI and the Cloud" — https://www.nvidia.com/en-us/networking/ethernet-switching/ [S12] NVIDIA, "High-Performance AI Networking | NVIDIA Ethernet SuperNICs" — https://www.nvidia.com/en-us/networking/products/ethernet/supernic/ [S13] Google, "Ironwood: The first Google TPU for the age of inference" — https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/ironwood-tpu-age-of-inference/ [S14] AWS, "AI Accelerator - AWS Trainium" — https://aws.amazon.com/ai/machine-learning/trainium/ [S15] Microsoft, "Maia 200: The AI accelerator built for inference" — https://blogs.microsoft.com/blog/2026/01/26/maia-200-the-ai-accelerator-built-for-inference/ [S16] Meta AI, "Four MTIA Chips in Two Years: Scaling AI Experiences for Billions" — https://ai.meta.com/blog/meta-mtia-scale-ai-chips-for-billions/ [S17] IEA, "Energy demand from AI" — https://www.iea.org/reports/energy-and-ai/energy-demand-from-ai [S18] Berkeley Lab, "Berkeley Lab Report Evaluates Increase in Electricity Demand from Data Centers" — https://bies.lbl.gov/news/berkeley-lab-report-evaluates-increase-electricity-demand-data-centers

本报告由AI基础设施分析师完成,并于2026-07-23写入工作区。