登录/注册

搜索历史清空

国产大模型登顶调用榜:低价策略的荣光与隐忧

 财中社 陈智佳  2026-08-10 17:56  3963阅读

公开信息显示,DeepSeek的API毛利率维持在70%-80%,年度经常性收入已达4-5亿美元。

全球模型聚合平台OpenRouter的最新周度榜单(截至8月2日)显示,前五名被国产大模型包揽——DeepSeek V4 Flash位居榜首,小米MiMo V2.5、腾讯Hy3、DeepSeek V4 Pro、智谱GLM 5.2依次位列其后。这一数据在行业内被迅速传播,被视为国产AI的里程碑时刻。

但在庆贺声中,有一个细节值得停下来审视:DeepSeek V4 Flash的官方定价为每百万Token输入1元、输出2元——在全球AI服务市场中处于极低水位。其调用量的跃升(7月27日至8月2日这一周达7.22万亿Token),与这一价格策略之间的关联,或许比单纯的“技术胜利”叙事更值得深入拆解。

登顶的逻辑:需求是被“触发”的,还是自然生长的?

DeepSeek V4 Flash此轮调用量攀升,并非完全源于市场的自发选择。从时间线来看,正式版上线后,DeepSeek与合作平台同步推进了旧版本用户的迁移及旧接口的停用。换言之,相当一部分存量用户是在产品策略的引导下集中转向新版本的。

这并非对版本迭代合理性的质疑——任何软件服务商在新版上线时都会采取类似操作。但值得留意的是,这种版本切换带来的集中效应,会使得调用量数据中包含一定比例的“策略性迁移”成分,与纯粹由新需求驱动的自发增长之间存在口径差异。这提示我们:直观的增长数字,未必等同于同比例的市场认可度扩张。

将低价策略与上述版本迁移因素并置观察,两者共同描绘了一幅颇具爆发力的增长图景。但这幅图景的可持续性,需要更长周期的数据来检验——当前的调用量中,有多少来自价格敏感型用户的试探性调用,又有多少来自不可逆的业务嵌入?

此外,智能体(Agent)应用场景的Token消耗量大,也是推高调用量的结构性因素。需求总量确实在扩张,这一点毋庸置疑。问题的关键在于:当前的需求增量是否对价格高度敏感?如果是,则调用量与低价之间的绑定关系就比表面看起来更为紧密——一旦价格策略发生调整,这种高弹性需求可能面临快速回落的压力,而这恰恰是“可持续性”命题中最需要被关注的变量。

技术优势是真实的,但能否撑起商业闭环?

国产大模型在工程能力上的进步是具体可感的。以DeepSeek V4-Flash为例,其采用混合专家(MoE)架构,总参数达2840亿,推理时仅激活130亿参数;通过DSA稀疏注意力优化,推理算力与KV Cache占用仅为前代V3.2的10%和7%——这构成了其极致低价的底层支撑。从灰度测试到正式发布再到多平台分发的快速迭代能力,同样是国内企业在工程执行层面的真实积累。这几家企业在多模态、代码生成、长程规划、复杂推理等方向上各有侧重,已形成一定的差异化格局。

这些技术优势是真实存在的,不应被低估。

但技术能力与商业可持续性并非同一件事。中国科技产业有过不止一次“以工程效率换规模、以规模换市场”的历程——光伏、LED、动力电池都走过类似路径:凭借成本控制快速拿下全球市场份额,然后在产能过剩与利润摊薄的双重压力下进入漫长的整合期。

大模型行业与制造业有本质差异,这一点需要承认。软件服务的边际成本结构不同于硬件产品,规模效应的逻辑也不完全相同。但关键问题依然存在:当前的定价,能否在覆盖算力成本的同时支撑持续的研发投入?公开信息显示,DeepSeek的API毛利率维持在70%-80%,年度经常性收入已达4-5亿美元——这在一定程度上回答了“能否覆盖成本”的问题。然而,毛利率不等于净利润,大规模融资、IPO筹备以及计划中的1GW算力数据中心建设,都意味着更长期的资金压力。

专家建议企业“将价格优势逐步延伸至推理工具链、行业解决方案等高附加值环节”,这是一条清晰的战略路径,但“如何延伸”和“延伸的时间窗口有多长”,仍是两个需要时间检验的悬置问题。

海外市场的另一面账单

调用量排名来自面向全球开发者的模型聚合平台OpenRouter。国产模型在该平台上的胜出,意味着海外开发者正在大量使用这些服务。这是真实的市场认可,也是真实的地缘政治风险敞口。

海外市场对数据合规、网络安全审计的要求正在趋严——这不是模糊的预判,而是已经在多个市场落地的监管现实。2026年8月2日,欧盟《人工智能法案》正式扩大适用范围,通用大模型服务商须履行模型风险评估、合规记录留存等义务,对违反大部分合规与监管义务的运营商,违规罚款最高可达1500万欧元或企业全球年营业额的3%。合规成本正随着调用量的增长而同步放大。

与此同时,OpenAI、Anthropic、Google等竞争对手已经做出了定价反应——OpenAI将GPT-5.6 Luna输入单价下调80%至0.2美元/百万Token,谷歌推出更低价的Gemini 3.6 Flash,Anthropic则以同等价格上线能力更强的Claude 5.0。这些调整被视为针对国产模型性价比优势的防守性动作。国产模型的价格优势正面临直接削弱。

高调用量会拉动国产推理芯片、服务器、存储等基础设施的需求——这是一个真实的正向溢出效应,对整个产业链有实质意义。但算力需求的增长本身也是成本。服务稳定性、故障恢复能力、持续的基础设施投入,这些都是流量峰值背后的隐性账单。

登上调用量榜首,是一个值得记录的时刻。但调用量和盈利能力之间,隔着一段中国科技产业并不陌生的距离。这段距离怎么走,才是这份榜单真正的考题。

重要提示: 本文著作权归财中社所有。未经允许,任何单位或个人不得在任何公开传播平台上使用本文内容;经允许进行转载或引用时,请注明来源。联系请发邮件至editor@caizhongshe.cn。

长按保存图片

24小时热门文章

最新文章