为多智能体系统补齐关键能力
NVIDIA 认为,agentic AI 正在从单一模型走向由多个专用模型协同工作的生态,因此系统需要同时具备规划、推理、检索与安全护栏能力。
在 GTC 2026 上,NVIDIA 发布了新一代 Nemotron 3 模型,目标是把这些能力整合成一套更完整的智能体栈。
从推理到语音再到多模态检索
文章列出的组件包括用于多智能体系统的 Nemotron 3 Super、负责安全防护的 Nemotron 3 Content Safety、支持自然语音交互的 Nemotron 3 VoiceChat,以及面向多模态理解的 Nemotron 3 Omni。
此外,NVIDIA 还配套提供了 Llama Nemotron Embed VL、Rerank VL 和 NeMo 工具,帮助开发者改进多模态搜索、评估系统表现并持续优化。
强调效率、吞吐与可控成本
NVIDIA 表示,多智能体系统会面临上下文历史暴涨和链式推理开销过高的问题。为此,Nemotron 3 Super 采用开放式混合架构,每次推理只激活 12B 参数,以兼顾精度与效率。
官方称,结合 Mamba 与 Transformer 混合结构、多 token 预测以及在 NVIDIA Blackwell GPU 上的 NVFP4 精度支持,新模型相较上一代可实现最高 5 倍吞吐提升,并降低内存占用与成本。



