能力榜前五没有国产模型,调用榜中国却连庄20周:大模型竞争换了把尺子

AI资讯20秒前发布 EdgeClaw
0 00

同一周出炉的两份榜单,读出了两个完全不同的格局。智能指数榜上,前五名清一色海外模型;而在开发者真金白银投票的API调用榜上,中国大模型已经连续二十周压过美国。模型竞争的衡量标准,正在从”谁更聪明”变成”谁更划算”。

两周七款新模型,能力榜仍是海外领跑

刚过去的十一天,七家头部厂商密集迭代。9月1日Anthropic推出Claude Fable 5.1和Mythos 5.1;2日谷歌Gemini 3.8 Flash、Meta Muse Spark 1.3同天上场;3日OpenAI甩出GPT-6 Astra。国内也没闲着,千问Qwen3.8-Max、DeepSeek V4.1 Flash、Kimi K2.8 Preview接连落地,升级周期已经按周计算。

但Artificial Analysis的智能指数榜上,差距依然写得明白:Fable 5.1第一,GPT-6 Astra第二,Muse Spark 1.3第四;排名最高的国产模型智谱GLM-5.3列第七,45分比头名少8分,Kimi K3排第九。单论能力,第一梯队还是海外厂商的地盘。

中美大模型API调用量份额反转趋势的数据流概念图

调用榜一年反转:中国份额从不足两成到反超

视角切到OpenRouter,剧情完全翻转。9月7日至13日这一周,平台总调用量达127万亿Token,环比增长10.4%;其中中国模型约61.2万亿,美国模型21.8万亿。这是中国大模型周调用量连续第二十周位居全球第一,可见的前十榜单里中国占了七席以上,合计份额超过70%。腾讯混元Hy4 Preview排第二,智谱GLM-5.3 Flash第三,DeepSeek V4 Flash第四。

一年前的数字几乎反过来。2025年9月当周,谷歌以约39%份额居首,美国厂商合计占八成,中国不足两成;如今DeepSeek以25.4%登顶,中国厂商整体份额超过45%。平台自身的周处理量也从一年前的4.92万亿涨到127万亿,扩容近25倍。

不过连庄不等于躺赢。同一周美国模型调用量环比增长31.6%,增速反而高于中国的7.9%,说明高端需求仍在扩张,这块市场远没有到定局的时候。OpenRouter也只是全球调用的一个切面,不能直接等同于整体份额,但流量迁移的方向已经足够清晰。

Token投入产出比ROI驱动大模型商业化的算力工厂概念图

每百万Token只要0.006美元,Token ROI成新标尺

开发者用脚投票的理由很直接:价格。9月10日发布的DeepSeek V4.1 Flash上线24小时处理约1万亿Token,48小时调用量有望达2.8万亿、创下平台新纪录;它约九成调用走缓存读取,每百万Token成本约0.006美元,比同档模型低约80%。有开源开发者坦言,除了复杂底层任务,多数应用层工作国产模型已经胜任,没必要为旗舰模型付数十倍价钱。

瑞银在近期交流中把这个趋势概括为”Token ROI”:企业关注点正从单纯的能力,转向每一分算力投入能换回多少产出。商业化数据也在印证,智谱刚把年末ARR指引从24亿美元上调到30亿美元,当前全业务ARR已达18亿美元,上半年收入同比增长近四倍,其中API收入占比超过八成六。

能力榜上的8分差距还在,但调用榜说明另一件事:绝大多数日常任务,并不需要为榜单前几名的溢价买单。当模型变成水电煤,性价比这把尺子,或许会比跑分更早决定下一轮格局。你的工作流,现在跑在哪家模型上?

© 版权声明

相关文章