前序研究 — TMT综合:AI推理经济学能否承接HBM驱动的$/token地板?
- 工作日期:2026-05-18(亚洲/新加坡)
- |
- 分析师:TMT行业分析师 | 立场:synthesize(综合)
- 主题:AI推理经济学、HBM驱动的交付$/token,以及Capex/电力瓶颈主线
截至2026-05-18,我对前序研究采取综合而非否定:HBM驱动的交付$/token上行不会在2026-2028年关闭AI硬件周期,但会把市场切成两层:一线自有栈的前沿推理仍有正向单位经济,通用API层则被开源模型价格压力压到成本线附近。正确结论不是“需求先于供给失败”,而是“需求仍强,但只有具备分发、电力、HBM配额、软件效率与变现入口的买家才配享受硬件倍数”。
1. 核心判断
AI推理经济学可以为一线平台承接HBM驱动的$/token地板,但无法为无差异模型访问承接。 前序研究已经说明,HBM4/HBM4E把Rubin级加速器中HBM占BOM比例抬升至约19-25%,而H100时代约10%,若客户不吸收成本,加速器毛利率将压缩约300-500bp。前序研究正确压力测试了token ASP与开源竞争能否吸收这一成本传导。TMT视角下,答案是分层的
| 层级 | 经济性 | 投资含义 |
|---|---|---|
| 前沿Agentic工作负载 | OpenAI GPT-5.5标价为每1M tokens输入$5、输出$30;Claude Opus 4.6为$5/$25;高价值代码、搜索、企业流程与多模态Agent仍能为时延、准确性、数据控制与工具可靠性付费。 | 支持NVDA/AVGO/AMD/TSM/HBM赢家,以及具备分发的云平台。 |
| 产品内嵌AI | Microsoft Copilot、Google Search/Workspace、Amazon Bedrock/AWS、Meta广告/助手闭环通过席位、广告、商业、云消费变现,而不只是转卖原始token。 | 若AI收入/Capex强度继续改善,支持超大规模厂商。 |
| 通用API与开源模型路由 | DeepSeek-V4-Flash价格为每1M tokens输入$0.14、输出$0.28;V4-Pro至2026-05-31临时折扣至$0.435/$0.87,原价为.74/$3.48。 | 压制API-only厂商、无电力/HBM的neocloud和二线模型利润率。 |
| 批处理、缓存与后台推理 | OpenAI和Anthropic均提供50%批处理折扣;Anthropic缓存命中为基础输入价0.1x;DeepSeek缓存命中价格极低。 | 低时效工作负载会从高价实时容量迁移出去。 |
因此,市场不应把所有token都按高价token估值。关键是高价实时输出token、缓存/批处理token与开源替代的结构占比。
2. 硬数据说明了什么
前序主线仍然成立。前序研究把讨论从“超大规模厂商是否削减Capex”转向“哪些MW能按时通电”;前序研究把硬件采购重估为tokens/MW;前序研究把配置从泛AI beta转向已通电MW、HV设备、中游气、液冷与能效领先硅;前序研究加入CoWoS/HBM第二物理瓶颈;前序研究加入需求侧压力测试。
最新公开公司信号仍支持“受约束的增长”,而非“周期崩塌”
- Microsoft在FY26 Q3电话会上称AI ARR超过$37bn,当季Capex为$31.9bn,其中约三分之二为GPU、CPU等短寿命资产;2026日历年Capex预计约90bn,其中约$25bn来自组件价格上行。公司还表示Azure需求继续超过可用产能,且至少到2026年仍会受约束。 [6]
- Meta的Q1 2026 10-Q指引2026年Capex约25-145bn,以支持AI与核心业务;Q1购置Property and equipment为9.00bn,且有$237.67bn不可取消合同承诺,主要与云容量、服务器、网络基础设施、数据中心及相关硬件有关。 [7]
- Amazon披露Q1 2026 AWS收入$37.6bn,同比增长28%,AWS经营利润4.2bn;过去12个月Property and equipment购置额(扣除处置和激励)同比增加$59.3bn,主要反映AI投资。 [8]
- Alphabet披露Q1 2026 Google Cloud收入$20.028bn、经营利润$6.598bn,同时披露Alphabet层面存在大量AI研发与技术基础设施使用成本。 [9]
这些信号重要,因为它们为硬件链提供了收入与产能利用率底线。它们不能证明所有AI Capex都有高ROIC,但能说明支付HBM-heavy加速器价格的买家不只是API转售商。它们拥有云、广告、生产力套件、搜索、应用商店、商业流量、企业客户,以及越来越多的保留容量合同。
3. Token价格阶梯:需求侧压力真实存在
价格栈足够宽,既提供支撑也制造压力
| 2026-05-18的供应商/模型信号 | 每1M tokens输入价 | 每1M tokens输出价 | TMT解读 |
|---|---|---|---|
| OpenAI GPT-5.5标准价 | $5.00 | $30.00 | 代码/专业工作实时前沿能力的高价地板。 [1] |
| OpenAI GPT-5.4标准价 | $2.50 | 5.00 | 主流前沿通道;批处理/flex可将有效价格减半。 [1] |
| Anthropic Claude Opus 4.6 | $5.00 | $25.00 | 高价企业/代码通道。 [2] |
| Anthropic Claude Sonnet 4.6 | $3.00 | 5.00 | 高量企业默认选择。 [2] |
| Google Gemini 3 Pro图像/文本定价信号 | $2.00 | 2.00文本/思考 | 仍属高端,但低于GPT-5.5/Opus。 [3] |
| Google Gemini 2.5 Pro | .25-$2.50 | 0.00-5.00 | 超过200k prompt tokens后长上下文价格上行。 [3] |
| DeepSeek-V4-Pro原价 | .74 | $3.48 | 开源权重对闭源前沿价格形成压力。 [4][5] |
| DeepSeek-V4-Pro至2026-05-31促销价 | $0.435 | $0.87 | 近期API价格冲击;但单独不足以跨过企业可靠性/SLA门槛。 [4] |
| DeepSeek-V4-Flash | $0.14 | $0.28 | 低价值、可容忍时延负载的通用路由锚。 [4] |
按60%输入/40%输出的简单混合口径,标价从GPT-5.5约每1M混合tokens 5.0、Claude Opus 4.6约3.0、Claude Sonnet 4.6约$7.8、GPT-5.4约$7.5,到DeepSeek-V4-Pro原价约$2.4、DeepSeek-V4-Pro促销价约$0.61、DeepSeek-V4-Flash约$0.20。它不是一个市场,而是一个价差高达75x的价格阶梯。
因此,前序研究的压力测试成立:通用token ASP无法吸收所有HBM成本上行。但这不等于硬件周期失败。HBM-heavy加速器会优先分配给token具备产品上下文的工作负载:代码Agent、企业流程自动化、搜索变现、广告排序/素材生成、云保留容量与高价值多模态推理。
4. 为什么HBM在一线推理中仍能出清
HBM不只是成本项。它购买的是内存带宽、上下文长度、批处理效率、高并发低时延,以及每已通电MW上更多有用token。DeepSeek-V4本身也强化了这一点:其发布强调1M上下文、稀疏注意力、token压缩与更低内存成本,这正是低价模型压制API价格、同时证明内存效率成为模型经济性核心的同一组软件杠杆。 [5]
对一线买家而言,HBM成本传导通过五条通道出清
- 利用率:保留容量和产品内嵌负载降低闲置GPU时间,优于投机型neocloud部署。
- 分发:Microsoft、Google、Amazon和Meta能通过席位、搜索、广告、云消费和商业流量变现,而不只是按token转售。
- 栈控制:定制ASIC、模型蒸馏、推测解码、KV-cache复用、MoE路由和调度软件降低每个有用token的交付成本。
- 服务差异化:数据驻留、安全、时延、企业支持、工具执行和可审计性,使其相对开源API维持溢价。
- 电力稀缺:已通电MW稀缺,使买家愿意为每MW有用输出更高的硅支付更高单卡BOM。
弱点在中间层:用高价HBM-heavy容量购买算力,却向DeepSeek、Qwen、Llama、Mistral和批处理/缓存路由锚定的市场出售通用API访问的模型提供商。这一层的利润率压缩风险最高。
5. 投资综合
前序配置结论应保留,但需加一个修正。半导体仓位仍应集中,但对超大规模厂商和AI软件敞口的门槛应从“AI使用量增长”提高到每已通电MW的可变现有用token。
| 细分 | 评级倾向 | 理由 |
|---|---|---|
| HBM与先进封装 | 高配 | SK hynix、TSM、ASE/Amkor/BESI/LRCX仍捕获HBM4/HBM4E与CoWoS-L的物理瓶颈租金。 |
| 加速器与ASIC龙头 | 选择性高配 | NVDA、AVGO、AMD及超大规模自研硅若能提升tokens/MW并锁定HBM配额,将继续胜出。 |
| 具备分发的超大规模厂商 | 选择性高配 | MSFT/GOOG/AMZN拥有云与企业通道;META拥有广告和消费端入口,但需更清晰证明AI变现相对Capex。 |
| 已通电电力、HV设备、中游气、液冷 | 高配 | 前序研究仍是瓶颈主题最可辩护的跨资产表达。 |
| API-only模型层和无电力/HBM的neocloud | 低配 | 同时面对HBM成本通胀和开源模型路由带来的价格通缩。 |
| 消费电子端侧AI | 中性至选择性 | 端侧推理会把一部分低价值token从云端转移出去,但不能替代HBM-heavy前沿推理;需关注PC/手机内存涨价压力。 |
对TMT组合而言,错误交易是“因DeepSeek降价而做空AI”。更精确的交易是“做多稀缺电力、HBM、封装与分发的拥有者;做空没有成本控制的通用token卖方”。
6. 监控触发条件
若出现以下情况,本综合结论将走弱
- 前沿模型输出ASP下调超过40%,且没有对应的利用率或tokens/MW提升。
- DeepSeek-V4-Pro在2026-05-31促销后仍把输出价维持在每1M tokens 以下,且企业买家大规模接受其SLA/安全画像。
- Microsoft、Google、Amazon或Meta披露2027年Capex实质性下修超过约15%,且不是时点递延。
- Samsung HBM4认证和CoWoS-L良率提升快于预期,提前消除15-20%高堆叠HBM缺口,从而压缩瓶颈租金,但也降低交付$/token。
- 电力侧队列改革把time-to-power压缩至30个月以下,削弱已通电MW稀缺溢价。
截至2026-05-18,上述条件均未触发。
7. 结论
我支持前序研究的压力测试,但将其综合为更窄的结论:AI推理经济学只有在token绑定差异化产品、分发、SLA与已通电容量时,才能吸收HBM驱动的$/token地板。开源模型价格会压缩通用API利润率,但不足以取消一线加速器需求。AI可投资栈仍然存活,但价值池不再是泛半导体beta,而是瓶颈租金加有用token效率。
资料来源
- OpenAI, API Pricing: https://openai.com/api/pricing/
- Anthropic, Claude API Pricing: https://platform.claude.com/docs/en/about-claude/pricing
- Google, Gemini API Pricing: https://ai.google.dev/gemini-api/docs/pricing
- DeepSeek, Models & Pricing: https://api-docs.deepseek.com/quick_start/pricing
- DeepSeek, DeepSeek-V4 Preview Release, 2026-04-24: https://api-docs.deepseek.com/news/news260424
- Microsoft, FY26 Q3 Earnings Conference Call, 2026-04-29: https://www.microsoft.com/en-us/investor/events/fy-2026/earnings-fy-2026-q3
- Meta Platforms, Q1 2026 Form 10-Q: https://www.sec.gov/Archives/edgar/data/1326801/000162828026028526/meta-20260331.htm
- Amazon, Q1 2026 Earnings Release, 2026-04-29: https://ir.aboutamazon.com/news-release/news-release-details/2026/Amazon-com-Announces-First-Quarter-Results/default.aspx
- Alphabet, Q1 2026 Earnings Release PDF: https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf
- Workspace prior card: research discussion/b2f8dbcb-5339-4240-8256-3cefd4d35b13/research note/report.en.md
- Workspace note: research note live files were missing and prior research noteswas reconstructed from the prompt snapshot supplied for this card.
*页脚 | TMT行业分析师 | 2026-05-18(亚洲/新加坡) | | *