中国AI大模型周调用量达美国4.7倍,连续二十周领跑全球
据《每日经济新闻》援引OpenRouter平台最新统计数据显示,过去一周(9月14日至9月20日),全球人工智能大语言模型的累计调用规模达到129万亿Token,较前一周小幅上涨1.57%。
分地区来看,进入榜单的中国AI大模型单周调用总量为67.46万亿Token,环比增幅高达10.28%;而同期美国AI大模型的周调用量仅为14.21万亿Token,环比大幅回落34.7%。这意味着中国大模型在全球调用量上的领先优势已持续整整二十一个周期,牢牢占据世界第一的位置。

值得关注的是,上周全球调用量排行榜前五位中,有四席被中国AI大模型占据。其中,DeepSeek V4.1-Flash跃居榜首,单周调用量飙升至15.8万亿Token,环比暴涨219%。

这款模型于9月10日上线,在编程能力和智能体(Agent)表现上实现了显著提升,同时进一步增强了多模态理解水平。技术层面,V4.1-Flash引入了全新的Causal-Encoder-Decoder(因果编码器—解码器)架构设计,使得全局KV Cache占用量缩减至V4-Flash版本的四分之一左右。
这一架构层面的改进为推理成本的降低打开了空间。按照DeepSeek公布的官方费率,V4.1-Flash每百万Token在闲时段的缓存命中输入、非命中输入以及输出费用依次为0.02元、1元和4元,相比前一代产品的0.05元、1.5元和4.5元,降幅分别达到60.0%、33.3%和11.1%;高峰时段的收费标准则为闲时的两倍。
DeepSeek方面表示,综合性能、开销、响应速度以及完成一项任务的总耗时等多项核心指标衡量,V4.1-Flash均已实现对V4-Pro的全面超越。
中信证券分析指出,国内模型未来将在"高性价比"与"前沿智能"两大方向上持续推进竞争格局。在DeepSeek的深度适配推动下,国产算力基础设施与本土大模型有望形成协同共振,同时低成本的推理服务也将推动FDE(前线部署工程师)角色及企业级智能体的规模化应用。
然而,Token单价的下调并不等同于单次任务的总体花费一定减少。第三方评测机构Artificial Analysis的测试结果显示,V4.1-Flash平均每项任务消耗约8.9万个输出Token,明显多于上一代V4 Flash 0731版本的大约6.2万个。该机构还特别指出,V4.1-Flash的生成内容存在较为严重的冗余问题(very verbose)。
排名第二的是智谱GLM 5.3 Flash,周调用量为14.1万亿Token,环比增长18%;第三名是腾讯混元Hy4 preview,周调用量12.5万亿Token,环比下降26%;第五名则是由DeepSeek-V4-Flash-0731(即DeepSeek-V4-Flash正式版本)拿下,周调用量9.44万亿Token,环比下滑18%。
声明:本文所载信息与数据仅供阅读参考,不作为任何投资依据,读者在使用前应自行验证准确性。据此做出的任何决策,风险由个人自行承担。
