7月16日深夜,月之暗面(Moonshot AI)正式发布了新一代基座大模型Kimi K3。这款拥有2.8万亿参数的模型一经亮相,就以全球最大开源模型的身份登顶各大技术榜单。更值得注意的是,月之暗面承诺采用改良MIT协议永久免费商用,完整权重将在7月27日面向全球开放下载。
在GPT-5.6和Claude Fable 5牢牢占据闭源旗舰位置的背景下,一个中国团队的开源模型闯入第一梯队,背后到底有什么门道?
核心参数解读:不只是”数字大”
Kimi K3的技术规格确实够硬:2.8万亿总参数,896个专家模块每次推理仅激活16个(MoE架构),100万Token上下文窗口,原生支持视觉理解。自研的KDA混合线性注意力机制将传统Transformer的O(N²)复杂度大幅降低,配合注意力残差(AttnRes)技术解决了深层网络的信息衰减问题。
翻译成人话就是:这个模型能一次性读完几十万字的文档或整个代码仓库,不需要分段处理;在长文本场景下不会”健忘”,前后逻辑保持一致。

榜单表现:前端代码能力拿下全球第一
在Arena.ai前端代码竞技场(Code Arena)的盲测中,Kimi K3以1679分力压Claude Fable 5(1631分)和GPT-5.6 Sol(1618分),拿下全球第一。这个榜单完全由开发者真实投票产生,模型身份在投票结束后才揭晓。
SWE Marathon长程任务评测中,Kimi K3拿到42.0分同样排名榜首,领先GPT-5.6 Sol的39.0分。在BrowseComp(网页深度调研)、OmniDocBench(文档分析)、SpreadsheetBench 2(Excel建模)等知识型任务中也均取得全球第一。

但月之暗面在官方文档中坦诚地写道:Kimi K3的整体表现仍落后于Claude Fable 5和GPT-5.6 Sol。第三方评测显示其幻觉率约51%,高于部分闭源模型。在极高难度数学物理推理中,也可能因推理预算耗尽导致输出截断。
实际能力验证:从芯片设计到视频剪辑
几个真实案例值得关注。在芯片设计领域,Kimi K3通过自主Agent连续运行48小时,使用开源EDA工具和Nangate 45nm工艺库,独立完成了一款芯片的构建、优化与验证,全过程无人工干预。在科研场景中,它用2小时完成了通常需要资深研究员1到2周的工作量:阅读20多篇论文、评估300多个状态方程、生成3000多行Python代码并构建交互式仪表盘。

视频创作方面,官方宣传视频就是Kimi K3自己剪辑的——从56段原始素材中完成选片、卡点、动作匹配和音频处理。开发者社区也做了大量实测,有人用它构建CS:GO风格的克隆游戏,三轮对话花费约60万Token,按API定价仅花了3.24美元。
免费商用意味着什么
这是Kimi K3最具行业冲击力的决定。改良MIT协议允许全球企业和开发者免费商用、私有化部署、二次开发,甚至可基于它衍生闭源商业产品,无需支付授权费。
成本方面的对比相当直观。Kimi K3的API定价为输入3美元/百万Token、输出15美元/百万Token,编程场景缓存命中率超90%后实际输入成本约0.3美元。相比之下,Claude Fable 5的输入约10美元、输出50美元。缓存命中后,Kimi K3的输入成本仅为Claude Fable 5的约三十分之一。

本地部署方面,轻量化版本可在消费级RTX 4090显卡加256G内存环境下运行。完整模型推荐64个以上加速器的supernode配置。月之暗面自研了Mini Triton编译器,原生适配华为昇腾、寒武纪等国产AI芯片,不依赖海外底层技术。
局限性同样需要正视
速度是用户反馈中最集中的吐槽点。Artificial Analysis测得Kimi K3输出约62 tokens/秒,低于同类模型约70 tokens/秒的中位水平。长文本生成和复杂推理的总等待时间会更长。
另一个问题是”话多”。Kimi K3完成Artificial Analysis整套评测用了约1.3亿输出tokens,接近同类中位数的两倍。这会同时影响阅读体验和调用成本。API定价相比自家上一代K2.6也明显上涨——输入价格涨了3倍多,输出价格涨了近4倍。
对行业的影响
Kimi K3的出现标志着开源大模型正式进入”3万亿参数级”时代。它证明了开源模型可以在多个维度逼近甚至超越闭源旗舰,同时以免费商用的方式大幅降低中小企业和开发者的AI使用门槛。
对于开发者而言,如果主要场景是大型代码仓库、复杂研究、长文档处理或前端与视觉迭代,Kimi K3值得第一时间测试。如果是日常问答、短文润色或低延迟客服,上一代K2.6或专用小模型可能更合适。完整模型权重将于7月27日在Hugging Face平台正式发布。






