NVIDIA 用单卡 Nemotron 兑现开放权重立场:免费模型为什么更能卖 GPU
作者:林岚|OC 开发者生态编辑
作者:林岚|OC 开发者生态编辑
据 CNBC 报道,NVIDIA 发布 Nemotron 3.5 Lightning,并允许企业免费下载、使用和修改。官方模型卡显示,它是一个总参数 300 亿、每次推理激活约 30 亿参数的混合 MoE 模型,提供 NVFP4 权重,面向工具调用、长上下文和本地 Agent 场景。
一句话结论:NVIDIA 免费提供模型不是离开商业模式,而是把模型价格降到零来扩大 GPU 使用量;真正开放的是可下载权重和部署选择,训练数据、完整训练过程以及硬件优化仍掌握在发布方手里。
OC 此前在《25家机构为何替开放权重站台》中判断,硬件、云、安全和企业软件公司支持开放权重,并不是不担心中国模型竞争,而是更担心 AI 市场只剩少数封闭 API。Nemotron 3.5 Lightning 把这个立场变成了产品:模型可以免费拿走,但无论部署在个人工作站还是企业集群,运行都需要计算设备。
“单卡可运行”也需要限定条件。模型采用 NVFP4 量化和稀疏激活,减少显存与每个 token 的计算量;这不代表任意一张旧显卡都能获得相同速度,也不代表 300 亿参数在每一步全部参与。兼容的 GPU、推理框架、上下文长度和并发量都会改变实际体验。

官方称模型支持最长 100 万 token 上下文,并给出 MMLU Pro 81.94、SWE-bench Verified 51.56 等成绩。这些是发布方模型卡中的测试结果,不是对所有硬件、量化配置和真实 Agent 工作流的独立保证。开发者更应该检查许可证 OpenMDW 1.1 的具体限制、显存需求、吞吐量,以及工具调用在自己的任务上是否可靠。
NVIDIA 同时发布 NeMo Switchyard,用于在多个模型之间按成本和任务选择路由。把模型、量化、推理和路由工具放在一起,说明其竞争目标不是成为另一个只卖聊天 API 的实验室,而是让更多模型在 NVIDIA 栈上被训练、微调和调用。开放权重扩大选择,也扩大底层算力消耗。
关键事实
- 来源:NVIDIA 模型卡、CNBC
- 涉及公司:NVIDIA
- 核心技术:混合 MoE、Mamba-2、Attention、NVFP4、多 token 预测
- 关键数字:300 亿总参数;约 30 亿激活参数;最长 100 万 token 上下文
OC 判断
Nemotron 3.5 Lightning 应被称为开放权重模型,而不是笼统地等同于传统开源软件。它确实给企业更多本地部署和修改空间,但是否形成健康生态,还要看许可证、训练透明度、非 NVIDIA 硬件支持和社区贡献能否持续。对 NVIDIA 而言,模型越便宜,算力需求越容易扩散。
为什么重要
- 对开发者:可以在本地或私有环境测试长上下文 Agent,但要按自己的硬件与任务重新评测。
- 对企业:开放权重降低 API 锁定,却可能把锁定位置转移到 GPU、量化格式和推理软件栈。
- 对市场:美国开放模型政策与芯片销售利益正在同一条产品线上汇合。
评论
围绕这篇文章补充信息、提出问题或分享观察。