Meta发布Llama 4.5:405B开源模型,Apache 2.0授权,每百万Token只要0.15美元

AI资讯5天前发布 EdgeClaw
10 00

Meta发布Llama 4.5:405B开源模型,Apache 2.0授权,每百万Token只要0.15美元

开源大模型的价格战,被Meta这一刀砍到了地板。9月1日,Meta正式发布Llama 4.5——一款405B参数的混合专家(MoE)开源模型,最大亮点是每百万Token的输入价格只要0.15美元,比Google Gemini 3.7 Flash便宜5倍,比OpenAI GPT-5.6 Sol便宜整整20倍。与此同时,它把授权协议从过去带有使用限制的Llama社区许可,升级成了完全开放的Apache 2.0。可以说,这是自Llama 3以来开源模型领域最具冲击力的一次发布。

410 tokens/s:目前商用模型里的速度王者

Llama 4.5最直观的卖点,是速度。官方数据显示,在H100 GPU上,它的推理吞吐达到410 tokens/s,不仅超过Gemini 3.7 Flash的340 tokens/s,也把GPT-5.6 Sol的180 tokens/s甩在身后,是目前速度最快的商用级模型。能做到这一点,核心在于架构设计:405B总参数中,每个Token只激活约130B参数,相比同规模密集模型,单次前向计算量减少约68%,这也是它能比很多小参数模型跑得还快的原因。

速度之外,能力也没落下。Llama 4.5支持128K上下文窗口,在FrontierCode 1.1 Main代码基准上拿到42.1分,虽与GPT-5.6 Sol的45.8分有差距,但考虑到16倍的成本优势,这个差距完全在可接受范围内。对于高并发、实时性要求高的场景,Llama 4.5的性价比尤其突出。

Llama 4.5每百万Token输入价格仅0.15美元,比GPT-5.6 Sol便宜20倍

Apache 2.0:从”半开放”到”真开放”

和速度、价格同样值得关注的是授权变化。此前Llama系列使用的是Llama社区许可,对月活超过7亿的应用有使用限制,企业商用需要单独找Meta谈授权。这次Llama 4.5改用Apache 2.0协议,意味着使用、修改、商用、再分发都不再受限,也不需要支付任何版税或使用费。

这对企业用户意义重大。过去受数据隐私要求影响、不敢把数据交给闭源API的公司,现在可以放心地把Llama 4.5部署在自己的GPU集群上,微调成适合自身业务的模型。对法律、医疗、金融这类垂直领域来说,Apache 2.0带来的定制自由,价值甚至超过模型本身的跑分。

Llama 4.5在H100上推理吞吐达每秒410个Token,领先商用模型

三种部署方式:从API到本地全都要

Llama 4.5支持三种部署路径:第一种是直接通过Together AI、Fireworks、Groq等API提供商按0.15美元/百万Token调用,适合不想碰GPU基础设施的团队快速试用;第二种是自托管,用vLLM或TensorRT-LLM在自己的H100集群上跑,全精度推理需要8张H100 80GB,4-bit量化则只要4张;第三种是走Groq的LPU硬件,吞吐能到1200 tokens/s,适合对延迟极其敏感的Agent类应用。

企业怎么选?参考标准其实很简单:每天Token处理量低于5000万,用API更划算;超过5000万,自托管更省;有严格数据驻留要求,只能自托管。按照官方测算,一个每天处理1亿Token的企业,用Llama 4.5每天花费约15美元,而用GPT-5.6 Sol要250美元,差距一目了然。

Llama 4.5改用Apache 2.0协议,使用、修改、商用全面开放

开源模型的每一次降价,都在给闭源API定价施加压力。Llama 4.5把”可以自己部署的开源模型”拉到了与闭源模型正面竞争的价位,接下来压力给到其他模型厂商了——要么拿出更强的能力,要么拿出更低的价格,开源生态的鲶鱼效应,才刚刚开始。

© 版权声明

相关文章