企业代理 COGS 压力测试
看板: [source-id-redacted] · 研究记录: 2/8 · 分析师: AI 基础设施分析师(ai-infrastructure-analyst)
立场: stress-test(对研究记录 01 有条件支持结论的压力测试) · 工作日期: 2026-07-05(Asia/Singapore)
根主题: AI 应用的 ROI 验证——从 Copilot 订阅到企业级代理
本报告问题: 在 2026–2027 年推理硬件与电力约束下,企业 AI 代理每 work unit 的真实 COGS 下降速度,是否足以支撑 75%+ 的软件毛利率?
工作区说明: 启动时共享看板目录在磁盘上并不存在(
research discussion/74a9baba-.../与research note/均缺失)。研究记录 01 内容依据上下文中的 session-brief 快照重建,本报告三份文件为全新写入。
1. 先给结论
压力测试结论:75%+ 软件毛利率可以守住,但它绝不是硅片成本自动下降的必然结果,而是"定价架构"的产物,不是摩尔定律式的天定命运。 每 token 成本确实在快速下降(Rubin 相对 Blackwell 现实提升 2–3 倍,headline 高达 10 倍 [S1][S2];API 挂牌价每年下降 30–50% [S6])。但有三股力量朝反方向拉,且在不利情形下会占上风
- 每 work unit 的 token 膨胀跑赢单 token 通缩。 一个代理式任务消耗的 token 是 2023 年一次聊天的 5–30 倍 [S9];高盛测算到 2030 年 token 消耗量增长 24 倍 [S10]。"一个完成的 work unit"是移动靶——即便单 token 更便宜,生产它的总成本仍在上升。
- 报表上的"成本下降"部分是会计幻觉。 超大规模厂商对 GPU 按约 6 年折旧,而架构迭代周期只有 18–24 个月;高盛 5→3 年敏感性测试将 2026–2031 年累计折旧推高约 1 万亿美元 [S3],Burry 估算 2026–2028 年少提折旧约 1760 亿美元 [S4]。报表 70–80% 的推理毛利率,对应的真实毛利率更接近 33–43%(OpenAI)[S12]。
- 电力是不通缩的地板。 数据中心集群周边零售电价已上涨 8–15%,批发价可能上涨最高 50%,变压器交期长达 2–5 年,一个 Rubin 机架功耗 190–230 kW(GB200 为 120–130 kW),到 2027 年将升至 600 kW [S7][S8][S14]。COGS 的这一部分不会随硅片曲线下行——它在上升(th_T01)。
净结论: 对于满足以下条件的厂商——(a) 按席位/结果定价并对每单位包含的 token 设上限,(b) 将 ≥60–70% 的用量路由到廉价/开源模型,(c) 不自持折旧中的硬件——每 work unit 的 COGS 下降幅度足以守住 75%+。而对于把前沿模型推理按挂牌价"无限量"转售的厂商,每 work unit 的 COGS 可能逐年上升——Uber 到 4 月就烧光了整个 2026 年的 AI 预算 [S11]。这一结论是锐化而非推翻研究记录 01 的 th_T10/th_T11。
2. 我认同研究记录 01 之处——通缩是真实的
研究记录 01(TMT)有条件支持软件厂商可维持高毛利,认为赢家通过工作流定价、数据上下文与模型路由来吸收推理波动。硬件曲线支撑了其中"通缩"的一半
- Rubin(Vera Rubin NVL72),H2 2026 量产: NVIDIA 宣称相对 GB200 推理吞吐提升最高 5 倍、每 token 成本降低 10 倍 [S1]。10 倍是基于有利配置的基准(Kimi-K2-Thinking,32K/8K);对广义 dense 模型推理,现实值约为 $0.02–0.03/百万 token,仍是相对 Blackwell 的 2–3 倍改善 [S2]。
- 挂牌价通缩: LLM API 价格自 2023 年以来下降超 90%;Gemini 3.1 Flash 的 $0.10/$0.40 每百万 token 相对 2023 年 GPT-4 上市价下降 99.7% [S6]。开源推理每年下降 30–50%,预计到 2027 年前仍以每年 3–5 倍速度下行后趋缓 [S6]。Epoch 确认下降迅速但在不同任务类型间不均衡 [S5]——这对代理很关键,代理正处在昂贵、长上下文、重推理的那一端。
- 路由套利空间巨大: 从 DeepSeek V4 Flash($0.14/$0.28)到前沿 Claude Sonnet 4.6($3 输入)的价差超过 20 倍 [S6]。正确路由的厂商无需等待下一代硅片即可捕获大部分通缩。
所以每 token 的成本引擎确实在起作用。我的分歧点在于——不能把它当作"充分条件"。
3. 压力轴 1 — 每 work unit 的 token 膨胀
对软件损益表真正重要的单位不是 token,而是一个完成的 work unit(一张已解决的工单、一份起草好的合同、一本已对平的账)。这个单位正在以 token 计膨胀
- 代理式模型每任务使用的 token 是 2023 年聊天机器人的 5–30 倍(Gartner,2026 年 3 月)[S9]。一次带工具+推理+迭代循环的 2026 年编排式交互约 .20,约为简单 2023 工作流的 30 倍 [S9]。
- 高盛预测 token 消耗量在 2026–2030 年间增长 24 倍至约每月 120 千万亿(quadrillion)token [S10]。
自测算 [自测算] — 刀锋边缘: 将每 work unit 的 COGS 变化建模为 Δ单token成本 × Δ每work-unit的token数。
- 有利情形: 单 token 成本 −55%(Rubin+路由)× 每 work-unit token +50%(推理深度温和攀升)= 0.45 × 1.50 = 0.675 → 约 −33%/年(COGS 下降,毛利安全)。
- 不利情形: 单 token 成本 −35%(路由受限、质量锁定前沿)× 每 work-unit token +100%(更深的多步自主)= 0.65 × 2.00 = 1.30 → 约 +30%/年(COGS 上升,75% 毛利被击穿)。
输入:−55%/−35% 来自 [S1][S2][S6];+50%/+100% 由 [S9] 的每任务 5–30 倍区间在代理采用爬坡期年化推导。净值的正负号取决于厂商是否对每个定价单位内的 token 增长设上限。 这是压力测试的运营内核:通缩必要,但不充分。
4. 压力轴 2 — 折旧让"成本"被低估
即便硬件改善本身也部分是会计问题
- 超大规模厂商将服务器使用年限从 3–4 年延长到 6 年,每年节省约 180 亿美元折旧 [S3]。对照 NVIDIA 真实 18–24 个月的迭代节奏,这是激进的。
- 趋势正在反转: 亚马逊 2025 年将一部分服务器从六年缩短到五年,明确援引 AI 加速的技术节奏 [S3]。高盛 5→3 年敏感性测试将 2026–2031 年累计折旧从约 3 万亿推高到约 4 万亿——1 万亿美元的摆动 [S3]。Burry 估算 2026–2028 年少提折旧、虚增利润约 1760 亿美元 [S4]。
- 对毛利问题的含义: 报表 70–80% 的推理毛利率与估计的真实毛利率 33%(OpenAI)/ 40%(Anthropic) 并存 [S12],因为前沿实验室在以低于成本定价推理,由 VC 和超大规模厂商的交叉补贴支撑 [S12]。软件厂商今天买到的"廉价 token"部分是补贴,而终将重估的折旧只是被递延、并未消除。建立在被补贴挂牌价之上的 COGS 曲线,高估了真实成本的下降速度。
这是对研究记录 01 最尖锐的修正:软件毛利论部分是在借用"折旧不足的基础设施"与"低于成本的推理定价"。一旦二者之一正常化,每 work unit 的 COGS 会阶跃式上台阶。
5. 压力轴 3 — 电力是不通缩的地板(th_T01)
硅片通缩,电子不通缩。
- 美国数据中心用电需求从 2023 年的 176 TWh(占美国用电 4.4%)增长到 2028 年的 325–580 TWh(6.7–12.0%) [S7]。PJM 将 2025/26 年新增约 7.9 GW、2026/27 年约 12 GW 归因于数据中心需求,令区域容量成本翻倍 [S7]。
- 达拉斯联储预计批发电价可能上涨最高 +50%;弗吉尼亚/德州/佐治亚的集群已出现 8–15% 的零售电价上涨 [S7]。变压器交期长达 2–5 年 [S8],迫使超大规模厂商转向自建"能源孤岛"和带抵押承诺的长期 PPA [S7]。
- Rubin 加剧了密度:190–230 kW/机架(CPX 变体约 370 kW)对比 GB200 的 120–130 kW、Hopper 的约 40 kW,到 2027 年将达 600 kW [S14]。每瓦性能改善,但每部署单位的绝对功耗与电价都在上升。
这正是任务书中"电力约束"内含的直接矛盾:COGS 的电力这一行是反通缩的。它在总成本之下设了一个地板,硅片曲线无法把每 work unit 的总成本压到该地板以下。这正是 th_T01(Time-to-Power / AI Gridlock)在软件损益表内部的体现,也是为什么纯粹基于硅片的"成本永远下降"论是不完整的。
6. 系统性背景 — 支撑这一切的补贴正在变薄
大型科技公司 AI 支出已突破 7250 亿美元,合计自由现金流预计在 2026 年夏季触及约零 [S13]。这直接连到 th_T11(capex ROI 分化,FCF 拐点未确认):让今日企业代理 COGS 看起来温和的"低于成本推理定价",正是由如今把 FCF 压到零的 capex 所融资的。一旦交叉补贴撤出——这是对零 FCF 的理性反应——企业代理的投入成本会独立于任何硅片进步而向上重估。COGS 的下降部分是一个融资选择,不只是工程结果。
7. 结论与条件
| 支撑 75%+ 软件毛利率的条件 | 成立? | 证据 |
|---|---|---|
| 单 token 硅片/路由通缩持续 2–3 倍/年 | 是 | Rubin 2–3 倍 [S1][S2];挂牌价 −30–50%/年 [S6] |
| 每定价 work unit 的 token 被封顶/受控 | 有条件 | 每任务 5–30 倍;+30%–100%/年 [S9][S10] |
| 厂商不承担 GPU 折旧风险 | 应用厂商成立 | 6→5 年反转,1 万亿摆动 [S3][S4] |
| 电力成本维持为 COGS 中小而稳定的份额 | 否 | 零售 +8–15%,批发最高 +50% [S7];th_T01 |
| 低于成本的推理补贴持续 | 脆弱 | 真实毛利 33–43%;FCF→0 [S12][S13];th_T11 |
回答本报告问题: 每 work unit 的 COGS 下降速度足够快——但仅对那一小部分厂商成立:其定价架构对每个定价单位内的 token 增长设上限、激进路由到廉价模型、并把折旧与电力敞口外包给超大规模厂商。 对其余所有人,5–30 倍的代理 token 膨胀、被递延的折旧、以及反通缩的电力地板三者叠加,会守住——甚至抬升——每 work unit 的 COGS。我对研究记录 01 做压力测试(部分否定其强形式):通缩是真实的但单靠它并不充分;75% 毛利率是一项站在"被补贴、折旧不足、电力受限"基础之上的定价与路由成就。
8. 交接
本报告揭示的约束性脆弱点是系统性的,而非行业技术性的:企业代理 COGS 数学依赖于由超大规模厂商 capex 融资、而该 capex 已把合计 FCF 推向零的"低于成本推理定价" [S13](th_T11)。下一个未解问题是宏观/市场结构层面的:这项交叉补贴何时撤出,撤出时企业代理 COGS 会怎样? 这是一个 capex 周期 / FCF 可持续性判断——属于 horizon 问题——因此交接给 global-macro [primary, horizon],而非电力行业专才。
资料来源 / Sources
- [S1] Tom's Hardware,"Nvidia launches Vera Rubin NVL72 AI supercomputer at CES — up to 5x inference performance and 10x lower cost per token than Blackwell, coming 2H 2026" — https://www.tomshardware.com/pc-components/gpus/nvidia-launches-vera-rubin-nvl72-ai-supercomputer-at-ces-promises-up-to-5x-greater-inference-performance-and-10x-lower-cost-per-token-than-blackwell-coming-2h-2026
- [S2] Barrack AI / tech-insider.org,"NVIDIA Rubin at GTC 2026: Technical Breakdown"(现实 $0.02–0.03/百万 token dense 推理,相对 Blackwell 2–3 倍)— https://blog.barrack.ai/nvidia-rubin-specs-architecture-2026/
- [S3] SiliconANGLE,"Resetting GPU depreciation: Why AI factories bend, but don't break, useful life assumptions"(3–4 年→6 年,约 180 亿节省;亚马逊 6→5 年;高盛 5→3 年 1 万亿摆动)— https://siliconangle.com/2025/11/22/resetting-gpu-depreciation-ai-factories-bend-dont-break-useful-life-assumptions/
- [S4] Level-Headed Investing,"Are AI Chip 'Useful Lives' Creating Useless Earnings?"(Burry 约 1760 亿美元少提折旧,2026–2028)— https://www.levelheadedinvesting.com/p/are-ai-chips-useful-lives-creating-useless-earnings
- [S5] Epoch AI,"LLM inference prices have fallen rapidly but unequally across tasks" — https://epoch.ai/data-insights/llm-inference-price-trends
- [S6] AI Magicx,"The LLM Pricing Collapse of 2026"(自 2023 年 >90%;Gemini 3.1 Flash $0.10/$0.40;开源 30–50%/年;到 2027 年 3–5 倍/年)— https://www.aimagicx.com/blog/llm-pricing-collapse-developer-guide-building-cheap-ai-2026
- [S7] Belfer Center(哈佛),"AI, Data Centers, and the U.S. Electric Grid: A Watershed Moment"(176→325–580 TWh;达拉斯联储批发 +50%;零售 8–15%;PJM 7.9/12 GW)— https://www.belfercenter.org/research-analysis/ai-data-centers-us-electric-grid
- [S8] Spotlight PA,"Data centers are straining the grid"(变压器交期 2–5 年,PPA 抵押)— https://www.spotlightpa.org/news/2026/04/data-centers-electricity-prices-rising-ai-power-demand-environment/
- [S9] LeanOps,"AI Agents Burn 50x More Tokens Than Chats"(Gartner 2026 年 3 月:每任务 5–30 倍 token;约 .20/次交互 ≈30 倍)— https://leanopstech.com/blog/agentic-ai-cost-runaway-token-budget-2026/
- [S10] Goldman Sachs,"AI Agents Forecast to Boost Tech Cash Flow as Usage Soars"(到 2030 年 token 增长 24 倍至约每月 120 千万亿)— https://www.goldmansachs.com/insights/articles/ai-agents-forecast-to-boost-tech-cash-flow-as-usage-soars
- [S11] SmarterX,"Uber, Microsoft, and Others Burning Through AI Budgets"(Uber 到 4 月烧光整个 2026 AI 预算)— https://smarterx.ai/smarterxblog/ai-costs-exploding-at-enterprise
- [S12] MindStudio / Arize,"Anthropic's 70% Inference Margins…" 与 "Model subsidies are ending"(报表 70–80% 对真实 OpenAI 33% / Anthropic 40%;低于成本定价)— https://www.mindstudio.ai/blog/anthropic-inference-margins-70-percent-api-costs
- [S13] TechTimes,"Big Tech AI Spending Tops $725 Billion: Free Cash Flow Hits Zero This Summer" — https://www.techtimes.com/articles/319306/20260629/big-tech-ai-spending-tops-725-billion-free-cash-flow-hits-zero-this-summer.htm
- [S14] Introl,"NVIDIA Vera Rubin: 600kW Racks by 2027"(VR200 190–230 kW/机架,CPX 约 370 kW,对比 GB200 120–130 kW)— https://introl.com/blog/nvidia-vera-rubin-gpu-600kw-racks-2027