跳到正文

NVIDIA 发布 Nemotron 3 Super:面向 Agentic AI,吞吐最高提升 5 倍

NVIDIA 发布开源模型 Nemotron 3 Super,参数规模为 1200 亿、活跃参数为 120 亿,并称其在 Agentic AI 场景下可实现最高 5 倍吞吐提升。

功思 AI 编辑部

约 1 分钟读完

NVIDIA 发布 Nemotron 3 Super:面向 Agentic AI,吞吐最高提升 5 倍

导语

NVIDIA 今日发布 Nemotron 3 Super。这是一款面向复杂 agentic AI 系统的开源模型,总参数规模为 1200 亿,其中推理时活跃参数为 120 亿。

NVIDIA 表示,该模型结合高级推理能力,可用于高精度完成自主代理任务。目前,Perplexity 已把它接入搜索和 Computer 中的 20 个编排模型之一,CodeRabbit、Factory、Greptile、Edison Scientific 与 Lila Sciences 等公司也在不同场景中接入该模型。

在企业软件领域,Amdocs、Palantir、Cadence、Dassault Systèmes 和 Siemens 正在部署并定制该模型,用于电信、网络安全、半导体设计和制造等工作流自动化。

核心信息

NVIDIA 认为,多代理应用面临两大约束:一是上下文膨胀,因完整历史、工具输出和中间推理会让 token 消耗最多增加到标准聊天的 15 倍;二是“思考税”,即复杂代理若每一步都调用大模型,会带来过高成本和较慢速度。

Nemotron 3 Super 提供 100 万 token 上下文窗口,NVIDIA 称这有助于让代理保留完整工作流状态、减少目标漂移。公司还表示,该模型在 Artificial Analysis 上拿到同体量模型中兼顾效率、开放性和准确率的领先位置,并推动 NVIDIA AI-Q 研究代理登上 DeepResearch Bench 与 DeepResearch Bench II 榜首。

在架构上,Nemotron 3 Super 采用混合 MoE 设计。NVIDIA 称,相较上一代 Nemotron Super,其可实现最高 5 倍吞吐和最高 2 倍准确率提升;在 NVIDIA Blackwell 平台上以 NVFP4 精度运行时,推理速度相较 NVIDIA Hopper 上的 FP8 最快可提升 4 倍且不损失准确率。

更多细节

NVIDIA 还以宽松许可开放了模型权重,并公开超过 10 万亿 token 的预训练和后训练数据集、15 个强化学习训练环境及评测配方。开发者可在工作站、数据中心或云端部署,也可通过 build.nvidia.com、Perplexity、OpenRouter、Hugging Face 以及多家云和推理服务伙伴获取。

参与讨论

正在确认登录状态…