9月21日,OpenRouter最新一周(9月14日至20日)调用数据出炉:全球大模型总调用量129万亿Token,环比微增1.57%。榜单第一的位置,被发布仅11天的DeepSeek V4.1-Flash以15.8万亿Token拿下,环比暴涨219%。
前五名四款国产,中国调用量是美国4.7倍
分地域看,中国大模型单周调用量67.46万亿Token,环比增长10.28%;美国模型为14.21万亿Token,环比下滑34.7%。中国模型的周调用量已是美国的4.7倍,连续21周排在全球首位。
单模型榜单前五名中,国产模型占了四席。DeepSeek V4.1-Flash排第一,周调用量15.8万亿Token;智谱GLM 5.3 Flash以14.1万亿Token居第二,环比增长18%。
腾讯混元Hy4 preview以12.5万亿Token位列第三,环比下滑26%;第四席由海外模型占据;DeepSeek V4-Flash 0731正式版以9.44万亿Token排第五,环比下滑18%。

KV Cache砍到四分之一,是登顶的底层原因
V4.1-Flash于9月10日正式发布,主打Coding与Agent能力,同时强化多模态理解。它采用全新的Causal-Encoder-Decoder(因果编码器—解码器)结构,全局KV Cache降至V4-Flash的约四分之一。
KV Cache是推理时占用显存的大头。压到四分之一,意味着同样的GPU能并发服务更多请求,单次推理的延迟和成本同步下降,为高频调用场景腾出了空间。
价格端,官方定价为每百万Token闲时缓存命中输入0.02元、未命中输入1元、输出4元,比前代的0.05元、1.5元、4.5元分别下降60%、33.3%、11.1%,高峰时段价格为闲时两倍。
按官方说法,V4.1-Flash在性能、费用、速度和任务总用时上已全面超越上一代旗舰V4-Pro。Flash版本反超Pro版本,是这一代更新最值得注意的信号。
单价更便宜,不等于单任务更省钱
另一面的声音同样值得看。第三方机构Artificial Analysis评测显示,V4.1-Flash平均每项任务消耗约8.9万输出Token,高于上一代V4 Flash 0731的约6.2万,该机构直接评价其输出”非常冗长”。

换句话说,模型愿意把话讲得更满,单Token价格虽低,乘以更大的用量之后,单项任务的总成本未必下降。便宜和冗长,恰好是同一枚硬币的两面。
高性价比推理正在改写落地节奏
从更大的视角看,近两个月Flash级模型密集出现:7月底DeepSeek V4 Flash、8月26日Qwen3.8-Flash-Next与GLM 5.3 Flash同日发布,9月V4.1-Flash接棒,参数均落在千亿级区间。
这类模型承接的正是Agent和编程这类高频、长流程任务。推理成本每下一个台阶,能放进生产环境的自动化环节就多出一批,企业级智能体的落地节奏随之加快。
券商研究的判断与此呼应:国产模型将沿高性价比与前沿智能两条路径竞争,深度适配之下国产算力基础设施与模型同步受益;低成本推理会率先改变前线部署工程师的工作方式,再向更重的企业级Agent渗透。
219%的周环比增速能维持多久,取决于冗长问题能否收住,以及假期前后十余款新模型的冲击。调用榜上的座次,接下来两周可能还会再换。








