弹性压力测试:中国开放权重模型对全球 GPU / HBM / 数据中心 / 电力需求的真实影响
研究: [source-id-redacted] · 研究记录 2/8 · 分析师: ai-infrastructure-analyst · 立场: stress-test(压力测试) 工作日期:2026-08-04(Asia/Singapore) · 预测窗口:2026Q3 – 2027Q2(未来四个季度)
1. 结论先行
总量物理需求上升,总量定价权下降。这是两个问题,而研究记录 01 在边际上把它们混为一谈了。
我支持研究记录 01 的核心拆分——Qwen3.8-Max 压缩的是模型层稀缺租金,而不是否定算力资本开支——但我要压力测试并部分否定其结论中隐含的那份从容:即"云/算力链是干净的受益方"。把弹性算式跑三遍,会得到一个令人不安的非对称
- 保护物理需求(GPU-hours、HBM bits、MW)的安全垫约为 3.6 倍。
- 保护为这些资本开支还本的收入的安全垫只有约 1.8 倍——只有前者的一半 [自测算,推导见 §6]。
更便宜的中国开放权重模型在四个季度内不会击穿算力需求,它击穿的是为算力融资的单位经济性。这是一个披着"量"外衣的利润率与 ROIC 故事。2026-07-28 Alphabet 财报引发 hyperscaler 抛售(尽管资本开支指引是上调的)[S34]——市场反应的变量是对的,理由是错的。
四个季度记分卡
| 层级 | 方向(2026Q3–2027Q2) | 幅度 [自测算] | 约束条件 | 置信度 |
|---|---|---|---|---|
| 加速卡出货量 | ↑ | 同比 +45–60% | HBM / CoWoS、电力 | 高 |
| GPU-hours 消耗 | ↑ | +80–110% | 已通电 MW、利用率 | 高 |
| HBM bits 消耗 | ↑ | +65–80% | DRAM 晶圆分配 | 高 |
| 美国数据中心 critical IT 容量 | ↑ | 41 GW → 约 52–55 GW 运行率 | 变压器、并网排队 | 高 |
| 数据中心耗电量 | ↑ | +30–40% | 同上 | 高 |
| 单位 GPU-hour 收入 | ↓ | −20 至 −35% | 模型层租金压缩 | 中 |
| capex / 云收入 | ↑ | 约 1.57× → 约 1.7× | 融资能力 | 中 |
| 闭源模型 API 毛利率 | ↓ | −8 至 −15pp | 开放权重替代 | 中 |
2. 就四个季度窗口而言,"电力"这半个问题在结构上是伪命题
在跑弹性之前先做约束检查。任务问的是更便宜的模型在四个季度内会增加还是减少数据中心与电力需求。对电力而言,答案由物理和采购周期决定,而不是由弹性决定
- 大型电力变压器交期已达 36–48 个月,长者延至 5 年,而 2020 年前基准为 24–30 个月 [S20]。
- 电网并网通常需要 长达四年 [S20]。
- 美国 2026 年宣布的 12 GW AI 数据中心容量中,仅约 5 GW 处于实际施工阶段,分析师警告年底实际通电率可能只有约 20% [S19]。
- 美国数据中心计划新增容量为 2026 年 13.6 GW、2027 年 36.3 GW,装机需求从 31 GW(2025)→ 41 GW(2026)→ 66 GW(2027) [S16]。
2026Q3–2027Q2 能够交付的兆瓦,是由 2022–2024 年做出的并网与变压器决策锁定的。交付周期比预测窗口长 3–5 倍。 因此,无论 token 价格发生什么,未来四个季度已交付 MW 的价格弹性约等于零。模型价格冲击只能表现为对 MW 的边际支付意愿下降——即体现在电价溢价和 GPU 租赁价差上——而不会体现在实际消耗的 MW 上。
这不是打太极,而是本报告最锋利的结论:就电力与厂房容量而言,"更便宜的模型会不会减少需求"这个问题,在四个季度内从构造上就不可能得到"是"的答案。 该问题只对 GPU-hours 和收入是良定义的。
佐证的价格信号全部指向需求破坏的反面:PJM 容量价格从 28.92 美元/MW-日(2024/25)升至 329.17 美元/MW-日(2026/27)——11 倍涨幅,若无价格上限则会打到 554.72 美元 [S17]。PJM 批发电价 2026Q1 均价 136.53 美元/MWh,对比 2025Q1 的 77.78 美元/MWh,独立市场监察方将其中 63% 的涨幅归因于数据中心负荷,对应约 93 亿美元的增量用户成本 [S18]。
与院内论点 th_p_d151b015(Time-to-Power 折价曲线)的对照: 我的证据确认并强化了它。2026-07-18 的数据点(变压器交期 3–5 年)被 36–48 个月至 5 年的口径独立验证 [S20],而 12 GW 中仅 5 GW 在建的比例 [S19] 为折价曲线提供了经验锚。一处修正:40–70% 的折价应落在没有锁定并网位置的纸面开发商身上,而不是落在已有通电排队位置的 hyperscaler 身上。更关键的是——中国开放权重冲击完全不会缩短 time-to-power;它通过在固定 MW 上抬高 token 需求,让已锁定的并网位置更值钱,而非更不值钱。
3. 拆解一 — 利用率:开放权重是"利用率破坏型"的
直觉上的空头逻辑是"模型更便宜 → FLOPs 更少 → GPU 更少"。而利用率通道的方向恰好相反,且通常被忽略。
闭源 API 服务是一种集中式负载:单一运营方、极大 batch、continuous batching、接近连续的占空比。开放权重服务把同样的 token 量碎片化到 neocloud、企业本地部署和私有 VPC 安装中——每一处的 batch 更小、占空比更尖峰、算术强度更差。
租赁市场留下了实证痕迹。公开的 B200 云价格区间为 每 GPU-小时 3.75 至 27.04 美元——同一硅片 7 倍价差 [S28];H100 在 2026Q2 为 1.80–3.50 美元/小时,现货低至 1.20 美元 [S28]。一种可替代商品出现 7 倍离散度,不是定价异常,而是利用率离散度,且会随服务碎片化而扩大。值得注意的是,单 token 价格下跌并未压低 GPU 租赁价格,因为更多客户在为推理租卡 [S27]。
工作假设 [自测算]: 四个季度内,由次规模部署承载的 token 份额从约 12% 升至约 25%,其利用率为 25–35%,而超大规模为 60–70%。因此混合利用率下降约 10%(乘数 ×0.90)。
4. 拆解二 — 推理结构:MoE 常驻内存陷阱
这是把"更便宜的模型"变成 HBM 需求加速器的机制。
Qwen3.8-Max 是 2.4 万亿总参数、950 亿激活参数、1M-token 上下文的 MoE 模型,定价 每百万输入/输出 token 2 / 6 美元,权重将在 Hugging Face 与 ModelScope 发布 [S1][S2][S3]。稀疏性降低了每 token 的 FLOPs,但没有降低内存常驻量:所有专家权重都必须驻留在 GPU 显存中才能被选中,哪怕每个 token 只读取其中一小部分——这使约束从 FLOPs 转移到了 HBM 容量 [S29]。一个 GLM-5.2 级别的模型在 FP8 下,在 KV cache 之前就需要约 750 GB 常驻 [S29]。
常驻量算式 [自测算] — 输入:2.4T 总参数 [S1];FP8 = 每参数 1 字节;H200 = 141 GB HBM3E
- 仅权重:2.4 TB ÷ 141 GB = 每个服务副本 17.0 张 H200 级 GPU。
- FP4/INT4(每参数 0.5 字节):1.2 TB → 约 8.5 张。
- 长上下文下 KV cache 并非零头:Qwen3-235B 实测 每 token 每 GPU 23.5 KB [S29],在 256K–1M 上下文下 KV cache 可等于甚至超过权重占用 [S29]。留出 1M-token 余量后,实际副本落在 约 20–24 张 GPU。
- 对照:一个激活算力相当的稠密模型(95B 参数、FP8)只需约 95 GB——1 张 GPU。
因此,2.4T 开放权重 MoE 消耗的 HBM 约为其 FLOPs 等效稠密模型的 17–24 倍。 这个"便宜"模型便宜在 FLOPs,昂贵在 HBM。每一家选择自托管 Qwen3.8-Max 而非调用闭源 API 的企业,都把一笔边际 FLOPs 采购变成了一份约 20 张 GPU 的固定显存承诺。
叠加在其上的是 token 侧的通胀
- 推理模型因内部思维链,每任务生成的 token 多 20–30 倍,且按输出 token 计费 [S26];DeepSeek-R1 已在规模上证明这一模式——通过每次查询生成 10–100 倍的 token 来匹配 o1 [S26]。
- 推理有望占到 2026 年全部算力的约三分之二 [S25]。
- 实测量:OpenRouter 在六个月内从约 5T tokens/周升至 25T/周(100T/月)——5 倍增长 [S21],至 2026 年 6 月约达 29.2T/周 [S22];从 2025 年 4 月约 5T/周到 2026 年 4 月超 20T/周,约为同比 4 倍 [S22]。
对院内论点 th_p_12baff1a(先进封装与高端材料价值量扩张)的确认与延伸: 我支持该论点,并补充一条独立的第二因果通道。现有论点由能效推导 HBM/CoWoS 价值量扩张——MW 约束迫使转向 GB200 NVL72 这类高能效硬件。我的发现是:开放权重 MoE 的常驻量在完全不引用能效论证的情况下也会拉高 HBM 含量。两条独立驱动指向同一方向,实质性提高了该论点的置信度。相符的市场数据:HBM 需求 2026 年同比 +70%,单颗 AI 芯片 HBM 容量从 96/192 GB 升至 216/288 GB,2027 年 Rubin Ultra 升至 384 GB [S10];HBM3E 2026 年交付合约价上调约 20% [S12];截至 2026 年 7 月现货约 300 美元/stack(HBM3E) 与约 500 美元/stack(HBM4) [S14],HBM4 预计翻倍以上至 4–5 美元/Gb,全球 HBM 合约价 2027 年将上涨数倍 [S11][S13]。AI 有望在 2026 年吸收全球约 20% 的 DRAM 晶圆产能,云端高速内存消耗达 3 EB [S13]。
5. 拆解三 — capex-to-cloud-revenue:真正的脆弱点在这里
物理需求是安全的,利润表不是。
2026 年资本开支承诺: Alphabet 将全年指引从 1,750–1,850 亿美元上调至 1,950–2,050 亿美元 [S5];Amazon 上调至 2,200 亿美元 [S6];Meta 上调至 1,250–1,450 亿美元;Microsoft FY2026 约 1,200 亿美元,对比 FY2025 的 882 亿美元 [S4]。四家合计约 2026 年 7,250 亿美元,较 2025 年约 4,100 亿美元 +77% [S4]。TrendForce 给出的全球前九大 CSP 口径约为 8,300 亿美元 [S9]。
对应的收入基数: 2026Q2 云基础设施收入 1,420 亿美元,同比 +43% [S8]。AWS 录得 422.3 亿美元 [S6];Google Cloud 约 250 亿美元,+82% [S5][S7];Azure 增长 43%,TTM 突破 1,000 亿美元 [S8][S5]。
[自测算] capex 对云收入比。 输入:前三大 2026Q2 云收入 = 422.3 亿(AWS)+ 约 250 亿(GCP)+ 约 270 亿(Azure,由 TTM >1,000 亿反推)≈ 每季约 942 亿美元 → 年化约 3,770 亿美元。前三大 2026 年 capex = 7,250 亿总额扣除 Meta 约 1,350 亿中值 ≈ 5,900 亿美元。比值 = 1.57×——每 1 美元年化云收入对应 1.57 美元资本开支。
[自测算] 折旧墙。 5,900 亿美元按 6 年折旧,年增 D&A 约 980 亿美元。前三大云收入在 3,770 亿基数上按混合约 50% 增长,年增约 1,890 亿美元——覆盖倍数约 1.9×。当下够用,但这是整个链条中最薄的一层。佐证:hyperscaler AI 资本开支滚动四季度达 4,340 亿美元,伴随明确的 D&A 滞后与债务潮 [S33];Amazon 滚动自由现金流已转为 −76 亿美元 [S6];内存成本通胀本身也在推高数据中心资本开支 [S35]。已披露的 capex-to-revenue 比率为 46%(Alphabet)、47%(Microsoft)、25%(Amazon)[S8]。
缓释项是合同在手订单,规模巨大: AWS backlog 4,960 亿美元,单季增加 1,320 亿 [S6];Google Cloud backlog +390% 至 5,140 亿美元,其中略超一半预计在 24 个月内转化 [S7]。Backlog 把资本开支风险转换成了交易对手风险——是另一种敞口,不是没有敞口。
6. 两个盈亏平衡点 — 本报告的核心结论
设物理需求 D = V × c / u,其中 V = token 量,c = 每 token 算力,u = 利用率。
盈亏平衡 A — GPU-hours 持平所需的 token 增速 [自测算] 输入:四个季度内每 token 算力改善 ×(1/1.25)(MoE 稀疏 + FP8/FP4 量化 + 投机解码,部分被推理 token 通胀抵消 [S26]);利用率乘数 ×0.90(§3)。
所需 V 增速 = 1.25 × 0.90 = 1.125×,即 token 量只需增长 +12.5%,GPU-hours 即可持平。 实测运行率:约同比 4.0× [S21][S22]。安全垫 = 4.0 / 1.125 ≈ 3.6×。
盈亏平衡 B — 推理收入持平所需的 token 增速 [自测算] 输入:四个季度内混合单 token 价格下跌约 55%(Qwen3.8-Max 的 2/6 美元定价对比前沿闭源 [S2];等效性能在 2026 年初已降至 每百万 token 0.40 美元,三年内 1,000 倍成本坍塌 [S27])。
所需 V 增速 = 1 / (1 − 0.55) = 2.22×。 安全垫 = 4.0 / 2.22 ≈ 1.8×。
结论:收入安全垫只有物理安全垫的一半。 物理需求需要 token 增速塌陷 72%(从 4.0× 降到 1.125×)才会使 GPU-hours 走平;收入只需增速下滑 45%(从 4.0× 降到 2.22×)。在一个合理的压力情景下——量增速降至 2.0×、价格下跌 55%——GPU-hours 仍上升约 44%,而 AI 推理收入下降约 10% [自测算]。这个组合才是真正的空头情形:一个正在全额折旧的资产基座被满负荷使用,但实现价格在跌。
关键在于:价格下跌的大部分并不是算力通缩。 在约 55% 的混合价格降幅中,我把约 35pp 归因于模型层利润与稀缺租金压缩,只有约 20pp 归因于真实算力效率提升 [自测算]。开放权重摧毁的是租金,不是成本。这正是"量受保护、利润率不受保护"的原因,也是研究记录 01 定性判断的定量化形式。
7. 地理重构 — 需求落在 Nvidia 指引基数之外
一个多空双方框架都未捕捉到的二阶效应。
Nvidia 对 FY2027 Q2 收入指引约 910 亿美元,Q1 数据中心收入 750 亿美元、同比 +92%,且该指引假设来自中国的数据中心算力收入为零 [S24]。与此同时,中国开放权重的 token 需求正落在中国资本开支上:阿里已承诺三年 3,800 亿元人民币(约 530 亿美元) 并预告更大计划;字节跳动 2026 年目标 1,600 亿元人民币(约 230 亿美元),其中约 130 亿美元用于 AI 处理器;腾讯翻倍至 360 亿元人民币;中国四大合计到 2027 年约 840 亿美元,较 2025 年 +60% [S31]。中国政府已批准字节、阿里、腾讯合计采购最多 40 万颗 Nvidia H200 [S32]。
两个后果。其一,在 OpenRouter 上,美国来源模型的 token 份额从 2025 年 6 月的约 70% 降至 2026 年 6 月的约 30%,中国来源实验室占已识别量的 46.4% [S22][S23]——但 token 份额显著高估了收入威胁,同时低估了物理产能威胁,因为这些 token 仍要在某处消耗 GPU-hours、HBM 与兆瓦。其二,无论中国的硅片组合最终如何落定(Nvidia H200 对国产加速卡),该需求对全球 HBM 与电力都是净增量,而对 Nvidia 收入只是有条件的增量。Nvidia 的指引基数排除了一块对 HBM 与电力链条而言真实存在的上行。
8. 分歧所在 — 对研究记录 01,也对学术先验
对研究记录 01(thematic-researcher,initial): 我支持"租金 vs 资本开支"的拆分,但否定其暗含的"正面主要落在具备托管推理、私有部署与容量稀缺的云/算力链"这一判断的干净程度。该链条的量是安全的,单位收入不是;敞口集中在 (a) 2026 年产能 vintage,以及 (b) 没有合同在手订单的 neocloud——它们正处在 7 倍租赁价差 [S28] 的错误一端。
对学术先验: Matsuoka(2026-07-08)建模了同样的四股力量——DRAM/HBM 涨价、具备前沿能力的开放权重、推理效率提升、新的算力转售方——但只给 "Jevons 吸收"20% 的概率,对应 25% 轮转地主寡头、25% 商品化崩塌、18% 系统层再差异化、12% 地缘分叉;其结论是只有 2027 年的产能 vintage 在各价格情景下均具韧性,2026 与 2028–29 vintage 敞口显著,且已宣布的扩张需要 token 需求年增 2 倍并维持溢价定价 [S30]。
我不认为这与我矛盾——这是不同的时间尺度。在 2026Q3–2027Q2,供给约束主导,物理需求本质上已被预先锁定;在 2028–2030,价格情景主导,他的概率分布是正确的先验。请注意在关键数字上的收敛:他的偿付条件是 token 年增 2×,我的收入盈亏平衡是 2.22× [自测算]。两条独立推导落在 10% 以内,这是本报告最强的单一结论。
9. 证伪观察清单 — 什么会推翻这个判断
按触发先后排序
- GPU 租赁价差收敛。 B200 离散度从 7 倍收窄到 3 倍以下 [S28],意味着产能不再稀缺。这是最早的可观测量,且先于任何报表变动。
- OpenRouter 周 token 同比增速跌破 2.2×——当前约 25–29.2T/周 [S21][S22]。这就是盈亏平衡 B 直接触发。
- HBM 合约价见顶回落,与 2027 年上涨数倍的预测相悖 [S11][S13]。
- PJM/ERCOT 容量价格见顶回落,自 329.17 美元/MW-日 [S17]。
- 任一 hyperscaler 下调资本开支指引。 目前四家全部相反 [S4][S5][S6]。
信号 1、2 在定价层触发,信号 3–5 在物理层触发。我的判断是:1–2 可能在四个季度内触发,3–5 不可能。
10. 对任务问题的正面回答
在 2026Q3–2027Q2,更便宜的中国开放权重模型会增加总量 GPU、HBM、数据中心与电力需求。GPU-hours +80–110%,HBM bits +65–80%,美国数据中心电力升至约 52–55 GW 运行率 [自测算,§1]。这一上升是超定的:即便 token 量增速减速 70% 它依然成立;而对电力与厂房容量而言,在本窗口内它根本不是一个需求问题——交付周期是预测窗口的 3–5 倍。
它们所减少的,是这些物理需求的单位收入:单位 GPU-hour 收入 −20 至 −35%,其中约三分之二由模型层租金压缩驱动,而非真实算力通缩。正确的做空标的不是算力链的量,而是以 77% 复合增长的资本开支基数与持续向下复合的实现单 token 价格之间的价差——集中在 2026 年资产 vintage、无合同覆盖的 neocloud 产能,以及闭源模型 API 毛利率上。
证据质量说明: 院内 OKF 事实库(数据中心 / HBM / 电力,/api/chain/export/okf/doc/...)在本工作区无法访问,故本报告未引用 OKF 事实。以下来源中有若干为二手聚合站而非一手申报文件,由其得到的数字已在行内标注,置信度为中。所有标注 [自测算] 的算式均已列出输入。
资料来源 / Sources
[S1] MarkTechPost, "Alibaba Previews Qwen3.8-Max, a 2.4 Trillion-Parameter Multimodal Model, Days After Moonshot's Kimi K3 Open-Weight Launch" — https://www.marktechpost.com/2026/07/19/alibaba-previews-qwen3-8-max-a-2-4-trillion-parameter-multimodal-model-days-after-moonshots-kimi-k3-open-weight-launch/ [S2] Developers Digest, "Qwen 3.8 Max Ships: 2.4T MoE, 1M Context, $2/$6 per MTok, Open Weights Next Week" — https://www.developersdigest.tech/blog/qwen-3-8-max-release-2026 [S3] CGTN, "Alibaba unveils Qwen3.8-Max, its most capable AI model to date" — https://news.cgtn.com/news/2026-08-03/Alibaba-unveils-Qwen3-8-Max-its-most-capable-AI-model-to-date-1Pj3AAwmjPa/p.html [S4] ValueAdd VC, "Big Tech's $725B AI Capex in 2026 — Up 77% From 2025" — https://valueaddvc.com/blog/big-tech-ai-capex-in-2025-microsoft-google-meta-amazon-and-the-spending-race [S5] MLQ News, "Alphabet Raises 2026 Capex Guidance to 95-205B, Cloud Revenue Surges 82%" — https://mlq.ai/news/alphabet-raises-2026-capex-guidance-to-195-205b-cloud-revenue-surges-82/ [S6] TechTimes, "AWS Backlog Hits $496B as Amazon Raises AI Spend to $220B and Capacity Runs Short"(2026-07-31)— https://www.techtimes.com/articles/322572/20260731/aws-backlog-hits-496b-amazon-raises-ai-spend-220b-capacity-runs-short.htm [S7] Cloud Wars, "Google Cloud Q2 Revenue Soars 82%, Backlog Jumps 390%" — https://cloudwars.com/cloud/google-cloud-q2-revenue-soars-82-backlog-jumps-390/ [S8] The Future Investors (X), "Cloud infrastructure revenue came in at 42B in Q2 2026 (+43% YoY)" — https://x.com/ftr_investors/status/2083120912132444609 [S9] TrendForce, "North American AI Data Center Expansion Drives 2026 CapEx of Top Nine CSPs to US$830 Billion"(2026-05-06)— https://www.trendforce.com/presscenter/news/20260506-13033.html [S10] TrendForce, "2026 Global HBM Market Forecast: AI-Driven Demand and HBM4 Production Trends" — https://www.trendforce.com/research/download/RP260206EZ [S11] Seoul Economic Daily, "HBM4 Prices to Double Next Year as Samsung, SK hynix Keep Upper Hand"(2026-07-12)— https://en.sedaily.com/finance/2026/07/12/hbm4-prices-to-double-next-year-as-samsung-sk-hynix-keep [S12] TrendForce, "Samsung, SK hynix Reportedly Plan ~20% HBM3E Price Hike for 2026 as NVIDIA H200, ASIC Demand Rises" — https://www.trendforce.com/news/2025/12/24/news-samsung-sk-hynix-reportedly-plan-20-hbm3e-price-hike-for-2026-as-nvidia-h200-asic-demand-rises/ [S13] TrendForce, "AI Reportedly to Consume 20% of Global DRAM Wafer Capacity in 2026, HBM and GDDR7 Lead Demand" — https://www.trendforce.com/news/2025/12/26/news-ai-reportedly-to-consume-20-of-global-dram-wafer-capacity-in-2026-hbm-and-gddr7-lead-demand/ [S14] Silicon Analysts, "HBM Pricing & Market Share (2026) — SK Hynix, Samsung, Micron" — https://siliconanalysts.com/tools/hbm-analysis [S15] Goldman Sachs, "US Data Center Power Demand Projected to Double by 2027" — https://www.goldmansachs.com/insights/articles/us-data-center-power-demand-projected-to-double-by-2027 [S16] Presenc AI, "Data Center Power Demand Tracker 2026: Gigawatts by Year" — https://presenc.ai/research/data-center-power-demand-gw-tracker-2026 [S17] IEEFA, "Projected data center growth spurs PJM capacity prices by factor of 10" — https://ieefa.org/resources/projected-data-center-growth-spurs-pjm-capacity-prices-factor-10 [S18] E&E News by POLITICO, "Data centers drive 76% surge in PJM power prices" — https://www.eenews.net/articles/data-centers-drive-76-surge-in-pjm-power-prices/ [S19] Tech Insider, "U.S. AI Data Center Delays: 7 GW Capacity Crisis [2026]" — https://tech-insider.org/us-ai-data-center-delays-cancellations-7gw-capacity-crisis-2026/ [S20] Enki AI, "AI Data Center Power: Grid Limits Reshape Energy in 2026" — https://enkiai.com/ai-market-intelligence/ai-data-center-power-grid-limits-reshape-energy-in-2026/ [S21] Tech Startups, "OpenRouter raises 13M as AI token usage surges to 100 trillion monthly"(2026-05-26)— https://techstartups.com/2026/05/26/openrouter-raises-113m-as-ai-token-usage-surges-to-100-trillion-monthly/ [S22] FourWeekMBA, "OpenRouter Usage Data Shows US AI Models Fell From ~70% to ~30% of Token Volume" — https://fourweekmba.com/ai-openrouter-us-models-token-share-deepseek-volume-revenue-spl/ [S23] Stock Alarm Pro, "OpenRouter's Real AI Rankings: DeepSeek Dominates, Chinese Labs Hold 46%" — https://pro.stockalarm.io/blog/openrouter-llm-rankings-investor-analysis [S24] Futurum Group, "NVIDIA Q1 FY2027: Data Center Diversification, Blackwell Scale, CPU Upside" — https://futurumgroup.com/insights/nvidia-q1-fy2027-data-center-diversification-blackwell-scale-cpu-upside/ [S25] Introl, "Inference-Time Scaling: Research on Reasoning Models" — https://introl.com/blog/inference-time-scaling-research-reasoning-models-december-2025 [S26] Newline, "Why Reasoning Models Increase Inference Costs" — https://www.newline.co/@Dipen/why-reasoning-models-increase-inference-costs--c7e247a0 [S27] GPUnex, "AI Inference Economics: The 1,000× Cost Collapse Reshaping GPUs" — https://www.gpunex.com/blog/ai-inference-economics-2026/ [S28] Silicon Analysts, "GPU Rental Price Decomposition 2026: Hardware, Power, and the Scarcity Premium" — https://siliconanalysts.com/analysis/gpu-rental-premium-decomposition-2026 [S29] DigitalOcean, "The MoE-ification of the Open Model Ecosystem, and What It Means for Your Inference Bill" — https://www.digitalocean.com/community/tutorials/mixture-of-experts-inference-cost [S30] Satoshi Matsuoka, "Memory Scarcity, Open Models, and the Restructuring of the AI Industry, 2026-2030"(arXiv,2026-07-08 提交)— https://arxiv.org/abs/2607.07207 [S31] South China Morning Post, "Alibaba, Tencent present a tale of two strategies for AI spending" — https://www.scmp.com/tech/big-tech/article/3353573/alibaba-tencent-signal-ai-spending-surge-despite-earnings-pressure-china-chips-ramp [S32] Data Center Dynamics, "Alibaba considers increasing AI data center capex spend to $69bn over three years" — https://www.datacenterdynamics.com/en/news/alibaba-considers-increasing-ai-data-center-capex-spend-to-69bn-over-three-years-report/ [S33] Silicon Analysts, "Hyperscaler AI Capex 2026: $434B Trailing Four Quarters, D&A Lag, Debt Wave" — https://siliconanalysts.com/analysis/hyperscaler-ai-capex-depreciation-wall-2026 [S34] CNBC, "Amazon, Meta and Microsoft face skeptical investors this week after Google report sparked sell-off"(2026-07-28)— https://www.cnbc.com/2026/07/28/hyperscalers-face-higher-capex-scrutiny-after-alphabet-report-panned.html [S35] Dell'Oro Group, "AI Infrastructure Buildouts and Memory Cost Inflation Drove Data Center Capex Higher in 1Q 2026" — https://www.delloro.com/news/ai-infrastructure-buildouts-and-memory-cost-inflation-drove-data-center-capex-higher-in-1q-2026/
研究记录 02/8 · ai-infrastructure-analyst · 工作日期 2026-08-04(Asia/Singapore)· 预测窗口 2026Q3–2027Q2