13款新模型、新工具,半个月内扎堆上线——2026年8月的NVIDIA,把”本地AI”这四个字彻底炸出了声。从自家30B参数的Nemotron 3.5 Lightning,到联手Meta推出的Muse Glimmer,再到能塞进一张消费级显卡的270亿参数大模型,本地跑AI这件事,正式从极客玩具变成了真能干活的生产力。
亲儿子Nemotron 3.5 Lightning:快4倍的可定制主力
先看NVIDIA自家这波的重头戏。Nemotron 3.5 Lightning是一款30B参数的MoE混合专家模型,定位非常明确:给”常驻在线的智能体”用。官方给出的数据是,token生成速度比同级别开源模型快4倍,端到端任务完成速度快30%。
它真正值钱的地方在”可定制”。因为是开源权重,开发者可以拿自己的数据微调,让它按你想要的风格、术语和流程来干活。写邮件报告就按公司定好的语气格式来,学特定领域的语言,或者按团队的代码规范写代码、审代码、改代码,都行。
部署上也很丝滑:vLLM、Ollama、llama.cpp、LM Studio全部直接支持NVFP4和GGUF两种格式,Unsloth同步上了优化版。硬件覆盖从RTX消费级显卡、Jetson边缘设备,一路到DGX Spark、RTX PRO工作站、GB300桌面超算和数据中心。
联手Meta:Muse Glimmer让数据不出本机
NVIDIA这波还把Meta拉上了船。Meta刚发布的Muse Glimmer是一款30B参数的dense稠密模型,上下文窗口12万+ token,专门为编码和本地智能体打造。关键数字是:在GeForce RTX 5090上,每秒能吐200+ token。

这意味着你可以在自己电脑上跑一个”常驻在线”的AI助手,让它翻你本地的文件、读邮件、调用各种API key、串起多步任务,全程数据不出本机。定制智能体、私密数据处理、凭据管理、多步任务、长时任务,这些场景它都覆盖,中间出错还能自动恢复。
配合DFlash推测解码还能再快一档——在RTX 5090上比无推测解码的基线快3.1倍,每秒233 token;即便在Apple M5-Max、M4-Max上也有1.5到1.8倍的加速。
Qwen3.8-27B:270亿参数塞进一张显卡
代码编程这块,NVIDIA这次主推的是Qwen3.8-27B——Qwen3.8-Max的”本地版”,270亿参数,单张显卡就能跑。官方测试数据:在一张GeForce RTX 5090上,配合多token预测优化,每秒能吐131 token,代码、工具调用、长流程开发任务全都能扛。
部署门槛极低,llama.cpp、Ollama、Unsloth、LM Studio Bionic全部开箱即用,NVIDIA RTX全系当天就支持。更关键的是Jetson边缘端也实现了day-zero支持——嵌入式设备跑270亿参数模型,这在以前是不敢想的事。

从”堆机”到”省钱”:DGX Spark集群与Switchyard
模型越来越大,单机跑不动怎么办?NVIDIA给了一个”堆机”方案:新版应用Sync能自动发现局域网里的多台DGX Spark,通过Tailscale做安全组网,你不用敲一行命令,就能把两台以上的DGX Spark配成高速集群,内存、算力、训练吞吐全部线性叠加。
算力侧忙活的同时,省钱工具也没落下。开源的NeMo Switchyard是一个模型路由库,能把智能体工作流的每一步自动分派到最合适的模型——按准确率、速度、成本动态选择。内部测试显示,在不牺牲任务完成质量的前提下,它能把成本压到单独用Opus 4.8时的三分之一左右。
13款新品全景:视频、世界模型、编程全覆盖
除了上面这几件,NVIDIA这波还拉来了一票合作方的新模型,13款一次看全:4B参数的开源世界模型Cosmos 3 Edge,给机器人和自动驾驶用;MiniMax-H3是33B参数,能从文本、图片、视频、音频任意一种或混合输入生成视频。
Poolside Laguna S 2.1是118B参数的智能编程模型,能扛数小时长任务;还有100万token上下文、284B参数的DeepSeek-V4-Flash,在DGX Station上就能装下。

阿里新发的Wan-Animate-2是14B模型,能把驱动视频里的动作和表情迁移到静态人像、卡通甚至机器人图片上。LTX-2.5则把开源视频生成推上新天花板。再加上桌面端”全干型”应用Unsloth Desktop,本地推理、图像视频生成、微调等功能全塞进一个APP。
云不再是唯一答案
这一波”本地AI大爆炸”透露出的信号其实很明确:算力下沉到桌面、到边缘,已经不是趋势,而是正在发生的事。从30B dense的Muse Glimmer到270亿参数的Qwen3.8,从4B的Cosmos 3 Edge到284B的DeepSeek-V4-Flash,模型生态全面铺开;硬件侧从消费级RTX 5090到DGX Spark集群再到GB300桌面超算,每个档位都有活干。
对普通用户和开发者来说,选择一下变多了:想要数据完全私有,本地跑一个常驻助手;想要便宜,用Switchyard在云端和本地之间自动调度。AI大模型跑在本地,2026年这事儿算是真成了。






