15.8万亿Token、环比暴涨219%:DeepSeek V4.1-Flash登顶OpenRouter,前五国产占四席

AI资讯59秒前发布 EdgeClaw
0 00

9月21日,OpenRouter最新一周(9月14日至20日)调用数据出炉:全球大模型总调用量129万亿Token,环比微增1.57%。榜单第一的位置,被发布仅11天的DeepSeek V4.1-Flash以15.8万亿Token拿下,环比暴涨219%。

前五名四款国产,中国调用量是美国4.7倍

分地域看,中国大模型单周调用量67.46万亿Token,环比增长10.28%;美国模型为14.21万亿Token,环比下滑34.7%。中国模型的周调用量已是美国的4.7倍,连续21周排在全球首位。

单模型榜单前五名中,国产模型占了四席。DeepSeek V4.1-Flash排第一,周调用量15.8万亿Token;智谱GLM 5.3 Flash以14.1万亿Token居第二,环比增长18%。

腾讯混元Hy4 preview以12.5万亿Token位列第三,环比下滑26%;第四席由海外模型占据;DeepSeek V4-Flash 0731正式版以9.44万亿Token排第五,环比下滑18%。

等距3D风格Token数据洪流汇聚成逐级抬升的发光柱状峰,象征V4.1-Flash调用量登顶

KV Cache砍到四分之一,是登顶的底层原因

V4.1-Flash于9月10日正式发布,主打Coding与Agent能力,同时强化多模态理解。它采用全新的Causal-Encoder-Decoder(因果编码器—解码器)结构,全局KV Cache降至V4-Flash的约四分之一。

KV Cache是推理时占用显存的大头。压到四分之一,意味着同样的GPU能并发服务更多请求,单次推理的延迟和成本同步下降,为高频调用场景腾出了空间。

价格端,官方定价为每百万Token闲时缓存命中输入0.02元、未命中输入1元、输出4元,比前代的0.05元、1.5元、4.5元分别下降60%、33.3%、11.1%,高峰时段价格为闲时两倍。

按官方说法,V4.1-Flash在性能、费用、速度和任务总用时上已全面超越上一代旗舰V4-Pro。Flash版本反超Pro版本,是这一代更新最值得注意的信号。

单价更便宜,不等于单任务更省钱

另一面的声音同样值得看。第三方机构Artificial Analysis评测显示,V4.1-Flash平均每项任务消耗约8.9万输出Token,高于上一代V4 Flash 0731的约6.2万,该机构直接评价其输出”非常冗长”。

玻璃拟态光带串联圆润卵石与水滴,表达推理成本下降与资源重新分配

换句话说,模型愿意把话讲得更满,单Token价格虽低,乘以更大的用量之后,单项任务的总成本未必下降。便宜和冗长,恰好是同一枚硬币的两面。

高性价比推理正在改写落地节奏

从更大的视角看,近两个月Flash级模型密集出现:7月底DeepSeek V4 Flash、8月26日Qwen3.8-Flash-Next与GLM 5.3 Flash同日发布,9月V4.1-Flash接棒,参数均落在千亿级区间。

这类模型承接的正是Agent和编程这类高频、长流程任务。推理成本每下一个台阶,能放进生产环境的自动化环节就多出一批,企业级智能体的落地节奏随之加快。

券商研究的判断与此呼应:国产模型将沿高性价比与前沿智能两条路径竞争,深度适配之下国产算力基础设施与模型同步受益;低成本推理会率先改变前线部署工程师的工作方式,再向更重的企业级Agent渗透。

219%的周环比增速能维持多久,取决于冗长问题能否收住,以及假期前后十余款新模型的冲击。调用榜上的座次,接下来两周可能还会再换。

© 版权声明

相关文章