品玩8月12日讯,据英伟达官方消息,NVIDIA近日推出开源模型Nemotron 3.5 Lightning,专为长时间运行的AI智能体执行层设计,旨在以更低成本和延迟处理高频任务。
该模型为300亿参数的混合专家(MoE)架构,激活参数仅30亿。通过混合专家路由机制,每次仅调用部分参数,实现大模型能力与小模型计算成本的平衡。模型采用推测解码、量化等技术,并针对OpenClaw、Hermes Agent等智能体框架优化训练,在保持高精度的同时,输出速度达同类模型的4倍。
NVIDIA同步推出NeMo Switchyard库,可智能分配任务至最合适的模型,实现复杂规划与高频执行的分工协作。该模型支持在DGX Spark、Jetson及GeForce RTX 5090等设备本地部署,并兼容Ollama、llama.cpp等主流工具。
目前,模型权重、训练数据及配方已按OpenMDW-1.1协议开源,开发者可通过Hugging Face、ModelScope等渠道获取。