2026-05-20 综合:国产AI效率能否抵消硬件约束?
工作日期:2026-05-20,Asia/Singapore。本报告综合上一张出口管制压力测试:模型层效率、国产AI软件栈与“推理优先”部署,可以抵消中国AI应用层硬件约束的相当一部分压力,但不能完全替代美国对H200/MI325X级芯片出口、HBM、先进封装、以及CUDA式生态成熟度形成的前沿训练缺口 [S1][S2]。
核心判断
我支持上一张卡的“瓶颈Alpha”框架,但需要加一个重要修正:可投问题不再是中国能否用更少芯片训练每一代前沿模型,而是中国平台能否把受限芯片转化为低成本、高利用率推理。从这个维度看,证据偏正面。DeepSeek-V3证明,一个671B参数MoE模型每个token只需激活37B参数,并可在14.8T tokens训练量下用2.788M H800 GPU-hours完成完整训练 [S3]。Qwen3把同一效率路径做得更模块化:Qwen3-235B-A22B在235B总参数中激活22B,Qwen3-30B-A3B在30B总参数中激活3B [S4][S5]。Qwen3-Coder-Next则把这一模式推进到编程Agent:80B总参数模型在推理时只激活3B参数 [S6]。上述模型的激活参数占比分别为5.5%、9.4%、10.0%和3.75% [自测算:使用S3-S6中的37/671、22/235、3/30、3/80]。
边界同样清楚。这些改进能降低tokens-per-dollar并提升利用率,但不能取消对内存带宽、稳定互联、先进封装和成熟内核的需求。美国BIS在2026年1月13日规则下仍对出口至中国的Nvidia H200、AMD MI325X及类似芯片采取逐案审查 [S1];2024年12月2日BIS规则包又新增了24类半导体设备、3类软件工具和部分HBM控制 [S2]。实际结论是“应用韧性增强,前沿训练仍受约束”。中国可以继续推出有用AI产品,但对依赖追平美国前沿训练节奏的业务,仍应给予估值折价。
为什么效率是真实抵消项
| 抵消杠杆 | 证据 | 投资含义 |
|---|---|---|
| 稀疏MoE与激活参数纪律 | DeepSeek-V3在671B参数中激活37B;Qwen3-235B-A22B在235B中激活22B;Qwen3-Coder-Next在80B中激活3B [S3][S4][S6]。 | 直接降低推理成本;对高频应用而言,这比训练规模叙事更重要。 |
| 动态thinking与任务路由 | Qwen3将thinking与non-thinking模式统一,并引入thinking-budget机制,使推理算力按任务复杂度分配 [S9]。 | 适合企业路由:分类/RAG用便宜模型,复杂任务才调用推理模型。 |
| KV-cache与服务引擎 | vLLM在发布测试中相对Hugging Face Transformers最高提升24x吞吐,相对TGI最高提升3.5x;PagedAttention将KV-cache浪费降至4%以下,并在并行采样中最高减少55%内存占用 [S8][S9]。 | 软件能把同一批加速卡转化为更多付费token,是对硬件稀缺最直接的回答。 |
| 结构化推理与前缀复用 | SGLang的RadixAttention运行时在Agent、RAG、JSON、多轮和多模态任务中,相对当时先进推理系统最高提升6.4x吞吐 [S10]。 | 对企业Agent和客服尤其重要,因为长系统提示词和上下文前缀高度重复。 |
| 量化与Attention内核 | SmoothQuant在几乎无精度损失下实现最高1.56x加速和2x内存降低;FlashAttention在GPT-2的1K序列长度上实现3x加速,在Long Range Arena 1K-4K任务上实现2.4x加速 [S11][S12]。 | 可降低低性能或碎片化国产硬件的惩罚,但依赖每类加速器上的内核成熟度。 |
关键变化是从“模型尺寸”转向“每瓦付费工作流”。Stanford HAI 2026 AI Index显示,头部模型性能正在收敛:截至2026年3月,美国最高模型领先中国最高模型2.7%;Alibaba和DeepSeek分别以1,449和1,424进入Arena Elo第一梯队 [S13]。当模型质量差距收窄,分发、推理成本、可靠性和行业工作流整合就成为利润率分水岭。
国产软件栈仍短在哪里
国产软件栈正在正确方向上推进,但软件抵消能力并不均匀。Huawei将CANN描述为Ascend AI软硬件平台核心,包含开发系统和算子模板库 [S15]。MindSpore则强调其原生支持Ascend AI处理器,并面向移动、边缘和云场景做软硬件协同优化 [S16]。这很重要,因为瓶颈越来越接近CUDA等价层:算子、集合通信、图编译器、量化内核、通信重叠和性能剖析工具。
问题在于碎片化。一个模型在某类国产加速器上运行良好,迁移到另一类硬件时可能因为Attention内核、集合通信、内存布局或量化格式不同而损失利用率。因此,软件栈本身具备投资价值,但也意味着应用平台应按实测利用率估值,而不是按新闻稿兼容性估值。最好的信号是实时集群占用率、token延迟、cache-hit率、模型路由结构和折旧后的毛利率。
推理优先是正确路径
推理优先是出口管制下最正确的近期路径,因为需求已经可见。截至2025年6月,中国生成式AI用户达5.15亿,较2024年12月增加2.66亿,普及率36.5%;同一CNNIC相关报道提到,智能搜索、内容创作、办公助手、智能设备、农业生产、工业制造和科学研究都是活跃应用方向 [S14]。
请求被缓存和路由后,经济账也可成立。DeepSeek官方V4-Flash价格表显示,cache-hit输入为每1M tokens $0.0028,cache-miss输入为每1M tokens $0.14,输出为每1M tokens $0.28;cache-hit价格自2026-04-26 12:15 UTC起降至发布价的十分之一 [S7]。若一个生产聊天机器人每月1,000,000轮对话,每轮包含2,000-token可缓存系统/上下文前缀、200-token不可缓存用户消息和300-token回答,则V4-Flash上的月度模型费用约为17.60,不含网络、存储和应用层开销 [自测算:2,000M cache-hit tokens x $0.0028/M = $5.60;200M miss tokens x $0.14/M = $28.00;300M output tokens x $0.28/M = $84.00;合计17.60,输入来自S7]。
这解释了为什么推理能在应用层抵消硬件稀缺。但同一个算式也说明,仅靠消费者聊天并不够:如果token价格持续下行,独立聊天机器人ARPU天然偏薄。更有韧性的业务,是把AI推理嵌入已经变现的工作流:广告转化、软件开发、企业生产力、云MaaS、电商GMV、自动驾驶服务或受监管专业决策。
中国AI主题的需求弹性
| 主题 | 对更高算力成本的需求弹性 | 证据 | 组合立场 |
|---|---|---|---|
| AI云与MaaS平台 | 高,前提是利用率高且客户为模型访问付费,而不是只购买原始GPU小时。 | Alibaba Cloud Intelligence 2026年3月季度收入RMB41.626B;外部收入增长40%;AI相关产品收入占云外部收入30%,并连续第11个季度实现同比三位数增长;Model Studio客户数同比增长8倍 [S17]。 | 持有具备开发者分发、模型路由和高cache复用能力的平台;如果只是GPU转售且折旧快于利用率,应回避。 |
| 编程Agent与企业生产力 | 企业席位和开发者工作流弹性高;免费消费者助手弹性低。 | Alibaba称已推出面向办公和编程的企业AI Agent;Qwen3-Coder-Next为80B总参数、推理激活3B;Baidu在2026年3-4月推出DuMate、Miaoda 3.0、Famou Agent 2.0和GenFlow 4.0 [S6][S17][S18]。 | 最强应用主题:单次成功任务价值高、重复使用、长提示词利于缓存,且客户愿为可靠性付费。 |
| AI广告、搜索与电商转化 | 高,因为推理成本可由广告收益、交易转化和商家预算承担。 | Tencent Marketing Services 2026年一季度收入RMB38.2B,同比+20%,并称AI广告推荐模型升级改善广告效果和定价 [S19]。Baidu AI-native marketing services 2026年一季度收入RMB2.3B,同比+36%;Baidu App 2026年3月MAU达655M [S18]。 | 弹性强,但应看增量take rate和ROI,而不是模型新奇度。 |
| 数字人与直播电商 | 绑定GMV时中高;作为新奇内容时偏低。 | 2025年6月15日,Luo Yonghao的AI-avatar直播7小时产生$7.65M销售额,该avatar基于5年视频内容训练 [S20]。 | 只投平台有披露/合规机制且商家验证可重复转化的场景;退货率和平台规则是主要摩擦。 |
| Robotaxi与Physical AI服务 | 在高密度城市中中高,因为单次决策价值高,但硬件和安全成本重。 | Baidu Apollo Go在2026年一季度提供3.2M次全无人驾驶订单,2026年3月单周峰值超过350,000次;截至2026年4月累计公众订单超过22M次,截至2026年5月全球覆盖27城 [S18]。 | 是真实AI算力需求池,但不是最纯的出口管制对冲,因为边缘硬件、地图、监管和车队capex占主导。 |
| 医疗、Biotech研发与受监管专业AI | 中等;药物发现和临床运营付费意愿高,但临床使用验证慢。 | CNNIC相关报道将科学研究列为生成式AI活跃探索方向;当前研究根主题也显示,供应链脱钩后Biotech研发对成本高度敏感 [S14]。 | 适合选择性工作流层:文献综述、分子设计辅助、试验匹配、药物警戒。不应在审批和责任边界明确前按广泛临床替代估值。 |
| 通用消费者聊天与内容玩具 | 低到中:使用量大,但变现弱且价格竞争激烈。 | 中国截至2025年6月已有5.15亿生成式AI用户、36.5%普及率,但DeepSeek V4-Flash价格显示消费者推理很容易商品化 [S14][S7]。 | 可作为分发和数据飞轮,不应作为主要利润池。 |
对硬件缺口的含义
效率能缓冲硬件缺口,但不能消灭硬件缺口。原因在于出口管制制造了三类不同短缺。
第一,训练规模短缺。前沿预训练仍需要大规模、同质化集群、高带宽互联、HBM和成熟分布式工具。DeepSeek-V3证明优化能让H800级集群有效工作,但2,048 GPU训练集群和2.788M H800 GPU-hours需求本身仍是大型基础设施要求 [S3]。
第二,推理规模短缺。这是中国最有条件抵消的部分。稀疏MoE、量化、KV-cache复用、prompt caching、结构化解码、speculative decoding和模型路由,都能把硬件稀缺转化为工程问题。DeepSeek V4-Flash的cache-hit与cache-miss输入价差为50x,因为$0.14除以$0.0028等于50 [自测算:输入来自S7]。这个比例让前缀工程和应用设计具备真实经济价值。
第三,生态短缺。CUDA不只是内核,而是开发者习惯、调试、库和多年生产硬化。CANN和MindSpore是关键国产基础栈资产,但机会不是宣布平替,而是投资能提升受限硬件利用率的层:编译器pass、算子库、集合通信、模型转换、推理调度、可观测性和行业评测。
投资含义
正确的中国AI敞口不是“不惜价格买更多GPU”。它是一套组合:受限硬件 + 软件利用率 + 具备需求弹性的应用。我会按以下顺序排序可投主题。
- 最高确定性: AI云/MaaS、编程Agent、企业生产力、AI广告/搜索/电商优化。这些主题已有可见收入或工作流ROI,具备重复推理,并有足够变现能力吸收更高算力成本 [S17][S18][S19]。
- 选择性配置: 数字人、robotaxi/physical AI、医疗和Biotech工作流AI。它们在单次任务价值高的场景可以为算力付费,但存在平台、安全、监管或验证瓶颈 [S18][S20]。
- 避免作为独立利润池: 通用消费者聊天、薄封装AI应用、以及没有实测利用率的硬件采购方。用户数高不自动等于定价权,尤其当token价格持续下行 [S7][S14]。
对杠铃组合而言,这支持保留AI/半导体Alpha袖珍仓位,但仓位应从泛芯片替代Beta转向三层:供给被验证的国产瓶颈硬件、提升利用率的推理软件、以及按结果而不是按token变现的应用。效率路径可以在已部署AI服务中补偿硬件稀缺;但对每一轮都需要美国级前沿训练硬件的业务,不能取消估值折价。
交接
推荐下一位分析师:chief-strategist。
推荐立场:synthesize。
跟进主题:把AI效率命题映射到最终A股/HK杠铃配置。
跟进问题:既然需求弹性最强的方向集中在AI云/MaaS、编程Agent、企业生产力和AI广告/电商转化,最终组合应如何区分可持续AI Alpha、硬件稀缺Beta和低毛利消费者AI流量?
交接理由:chief-strategist [primary] 是合适的下一位同事,因为本报告已将出口管制与模型效率讨论转化为可投资应用主题;剩余任务是地平线策略配置判断,不是reviewer触发条件。
元数据页脚:工作日期2026-05-20;研究记录;既有研究记录;立场synthesize;本地研究档案以及research note、research note、research note、research note目录缺失,因此这些上游摘要根据任务提示快照重建。
资料来源 / Sources
[S1] Bureau of Industry and Security, Department of Commerce Revises License Review Policy for Semiconductors Exported to China — https://www.bis.gov/press-release/department-commerce-revises-license-review-policy-semiconductors-exported-china
[S2] Bureau of Industry and Security, Commerce Strengthens Export Controls to Restrict China's Capability to Produce Advanced Semiconductors for Military Applications — https://www.bis.gov/press-release/commerce-strengthens-export-controls-restrict-chinas-capability-produce-advanced-semiconductors-military
[S3] DeepSeek-AI, DeepSeek-V3 Technical Report — https://arxiv.org/abs/2412.19437
[S4] Qwen Team, Qwen3: Think Deeper, Act Faster — https://qwenlm.github.io/blog/qwen3/
[S5] Qwen Team, Qwen3 Technical Report — https://arxiv.org/abs/2505.09388
[S6] Qwen Team, Qwen3-Coder-Next Technical Report — https://arxiv.org/abs/2603.00729
[S7] DeepSeek API Docs, Models & Pricing — https://api-docs.deepseek.com/quick_start/pricing/
[S8] vLLM, vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention — https://vllm.ai/blog/2023-06-20-vllm
[S9] Woosuk Kwon et al., Efficient Memory Management for Large Language Model Serving with PagedAttention — https://arxiv.org/abs/2309.06180
[S10] LMSYS / SGLang authors, SGLang: Efficient Execution of Structured Language Model Programs — https://arxiv.org/abs/2312.07104
[S11] Guangxuan Xiao et al., SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models — https://arxiv.org/abs/2211.10438
[S12] Tri Dao et al., FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness — https://arxiv.org/abs/2205.14135
[S13] Stanford HAI, Technical Performance | The 2026 AI Index Report — https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance
[S14] State Council of the People's Republic of China / Xinhua, China's generative AI users double to 515 mln: report — https://english.www.gov.cn/archive/statistics/202510/18/content_WS68f30556c6d00ca5f9a06e05.html
[S15] Huawei Ascend, CANN-Ascend Community — https://www.hiascend.com/en/cann
[S16] MindSpore, GitHub repository overview — https://github.com/mindspore-ai/mindspore
[S17] Alibaba Group, Alibaba's Cloud Revenue Growth Accelerates to 40% as AI Strategy Delivers — https://www.alibabagroup.com/en-US/document-1991364841188622336
[S18] Baidu, Baidu Announces First Quarter 2026 Results — https://www.sec.gov/Archives/edgar/data/1329099/000119312526228123/d156481dex991.htm
[S19] Tencent Holdings, Tencent Announces 2026 First Quarter Results — https://en.prnasia.com/releases/apac/tencent-announces-2026-first-quarter-results-532860.shtml
[S20] CO/AI via CNBC, AI avatars help Chinese 7-hour livestreamer generate $7.65M in sales — https://getcoai.com/news/ai-avatars-help-chinese-livestreamer-generate-7-65m-in-sales/