(文/连政 编辑/吕栋)

近期,月之暗面Kimi、阿里千问接连发布新模型,中国模型在参数规模、长上下文和推理成本上持续推进,引发外媒关注。但Kimi K3上线后,其需求迅速增长,也让月之暗面不得不紧急暂停部分新用户订阅。

7月19日,月之暗面发布公告称,过去48小时用户请求量已大幅超出预估,并且逼近现有集群的承载极限。为了保障已有订阅用户的体验,即日起暂停C端新用户订阅,将已有算力全部投入于服务已订阅用户。

同时,月之暗面表示,公司已在全速推进算力扩容。随着新算力陆续到位,将逐步开放更多订阅名额直至全面恢复正常订阅。但对于后续新订阅用户,将拆分为两种订阅方案,以方便更精准匹配算力,保障用户体验。

市场通常认为,假如一次模型推理所需的时间减少一半,企业需要的GPU也可能随之减少,但如今Kimi面临的却是“算力紧缺”,显然与公司的算力库存决策有关,但是,这也是不光是Kimi遇到的情况。

早在今年4月,Anthropic公司的Claude云平台也因使用量激增而发生重大服务中断。而2026年至今,美国已发生两次重大云服务中断,其中一些是云服务历史上最严重的故障,“算力短缺”或已成为一种新的常态。

中国新模型扎堆面世

7月16日,月之暗面推出Kimi K3。公布的信息显示,这款模型拥有2.8万亿参数、原生多模态能力和100万Token上下文窗口,采用MoE混合专家架构,共计896个专家,每token仅激活16个。

月之暗面称,K3为首个达到“3万亿参数级别”的开放模型,主要面向长周期编程、知识工作和复杂推理任务,并计划在7月27日前公布完整权重和更多技术资料。

Kimi K3

而在K3上线三天后,阿里巴巴也发布了旗舰大模型Qwen3.8 Max预览版,该模型拥有2.4万亿个参数,已经接入阿里的部分编程产品。阿里称其综合能力仅次于美国人工智能公司Anthropic的Claude Fable 5,随后将开放模型权重。

与此同时,市场还在等待DeepSeek V4正式版。今年4月,DeepSeek已开放V4 Pro和V4 Flash预览版,两款模型均支持100万Token上下文以及思考、非思考两种模式。此前市场传闻称,V4正式版已经进入小范围测试,预计7月中旬推出,不过目前看来实际公布时间要后延。

另外,DeepSeek团队当时还披露了较明确的V4长上下文效率提升数据。根据DeepSeek公布的技术资料,在100万Token上下文的单Token推理测试中,V4-Pro所需算力约为DeepSeek-V3.2的27%,KV缓存约为后者的10%。

需求会爆发,但产能则需要爬坡

当推理价格下降、能力更强时,更多原本不经济的应用,也在开始接入人工智能,最终抵消甚至超过单位节约的用量。

对此,高盛就预计,随着消费者和企业采用AI智能体,全球Token消耗量可能在2026年至2030年间增长24倍,达到每月12京(120 quadrillion,120,000,000,000,000,000)个Token。而智能体除了回答问题,还会搜索资料、调用工具、运行代码、检查结果,并根据反馈反复执行任务。每项工作包含的模型调用次数因此可能大幅增加。

高盛分析师特别提到,“我们甚至不知道quadrillion之后是什么概念,但可以肯定的是个很大的数字。”

摩根士丹利在今年2月发布的一份报告中也指出,大模型效率提升并不会消除硬件需求,而是会扩大在经济上可行的应用范围。随着AI工作负载由集中训练转向持续推理,模型开始处理多步骤任务、连接外部工具并进入自动驾驶和机器人等物理场景,对芯片、HBM、服务器、网络和电力的需求都会增长。

需要注意的是,上述数字是投行估算,并非芯片厂商披露的统一订单口径,但它的确反映了当前产业的主要问题仍是供给不足。

英伟达现在是最大受益者,但以后不一定

不可否认的是,面对如此大的新增算力市场缺口,英伟达将成为最大直接受益者,直接掌握了定价权。

根据财报显示,截至2026年1月25日的2026财年,英伟达收入为2159亿美元,同比增长65%。在随后截至4月26日的2027财年第一季度,公司收入进一步升至816亿美元,数据中心收入达到752亿美元,非美国通用会计准则毛利率为75.0%。其中,英伟达高达75%的毛利率体现了较强的议价能力,但也会促使客户去寻找替代方案、或者自研芯片。

这里还有一个很现实的问题,算力缺口不是英伟达一家可以填的上的。就像木桶效应一样,先进半导体、HBM、系统集成和电力均为约束AI扩张的实体瓶颈,任何一个环节受到限制,都可能使已经生产出的部分芯片无法按期组成可用集群。

英伟达CEO黄仁勋此前表示,面向Blackwell和Rubin平台、预计在2027年前兑现的高置信需求和采购订单规模可能接近1万亿美元,部分GPU及定制芯片的交货周期可能超过12个月。

摩根大通也预计,HBM方面,海力士、美光等三家主要供应商的2026年产能,目前也已基本被客户锁定。另外,北美数据中心市场的空置率已连续两年维持在约1%,在建容量中约92%也已获得预租承诺。

海力士的HBM4 资料图

需要注意的是,英伟达GPU优势在于成熟的软件生态、稳定的大规模集群和灵活的通用计算能力,但训练和推理对芯片的要求并不完全相同。对于规模较大、重复度较高且模型版本相对稳定的推理任务,客户通常更加重视每Token的成本、内存容量和能耗,定制ASIC的经济性因而更容易体现。

而中国市场,目前已经开始出现模型适配、询单和争夺货源的迹象。

国产芯片与存储的窗口

今年4月,路透社曾报道称,DeepSeek V4针对华为昇腾芯片进行适配后,互联网大厂向华为询问新增订单,云计算和GPU租赁公司也在争夺货源。

7月19日,WAIC2026,昇腾950超节点真机(Atlas 950 SuperPoD)首次公开亮相.

而机会也不仅存在于计算芯片。推理过程需要频繁读取模型权重,并为长上下文保存庞大的KV缓存,内存容量和带宽也是新的瓶颈。

目前中国最大的DRAM制造商长鑫存储在2025年获得约7.7%的全球市场份额,成为全球第四大DRAM企业。其2026年第一季度收入仍同比增长719%,达到508亿元。不过,长鑫在HBM等先进产品上仍明显落后于SK海力士、三星和美光,后者拥有更成熟的制造工艺、堆叠封装技术和客户认证经验。

鉴于过去几年的DRAM大涨,为降低长上下文推理的存储成本,一些大模型开始探索HBM、DRAM和SSD之间的分层存储,并将部分低频访问的模型数据或KV缓存卸载至SSD。在这个领域,长江存储则计划新建两座工厂,加上即将完成的另一座工厂,三座工厂全部运行后,其产能预计将较现有规模增加一倍以上。

由此可以预见,未来一次大模型的的突破,所带来的算力缺口可能同时为芯片、DRAM、HBM、NAND以及先进封装、光互联和服务器系统提供市场。而中国还拥有庞大的模型用户和云计算需求,也有足够多的应用场景允许芯片公司与模型厂商反复适配,这为软硬件协同提供了现实基础。

短期内,全球高端AI基础设施仍主要由英伟达及国际存储厂商供应。未来,中国可能在推理芯片、超节点互联、模型与芯片共同设计以及国产存储组合上,形成一套成本可控、供应稳定并能服务中国市场的体系。

本文系观察者网独家稿件,未经授权,不得转载。