导语
AWS 在 NVIDIA GTC 2026 期间宣布,将与 NVIDIA 进一步扩大长期合作关系,把重点从“支持 AI 实验”进一步转向“帮助客户把 AI 真正跑进生产环境”。AWS 在文章中反复强调,企业现在需要的不只是模型演示,而是能稳定运行、满足安全与合规要求、并能在大规模场景下持续交付业务结果的 AI 基础设施。
这次合作扩展的规模相当大。AWS 表示,从 2026 年起将在全球云区域新增超过 100 万块 NVIDIA GPU,覆盖 Blackwell 与 Rubin 架构。对于当下普遍面临算力供给焦虑的企业和开发者来说,这意味着 AWS 试图进一步巩固自己在云端 AI 基础设施市场的供给能力,同时用 NVIDIA 最新芯片路线来承接代理式 AI 和大模型推理需求。
除了纯粹增加 GPU 数量,双方还宣布将推出搭载 NVIDIA RTX PRO 4500 Blackwell Server Edition GPU 的 Amazon EC2 新实例。AWS 称其适用于数据分析、对话式 AI、内容生成、推荐系统、视频流和图形渲染等多种负载,并会建立在 AWS Nitro System 上。文章特别强调 Nitro 的资源隔离、安全性和在线更新能力,试图向企业客户传递一个信号:即便是高敏感度 AI 工作负载,也能在云上获得更强的隔离和可运营性。
核心信息
在推理基础设施层面,AWS 和 NVIDIA 还把协同重点放在“分离式推理”上。文章宣布,NVIDIA 的 Inference Xfer Library(NIXL)将与 AWS EFA 一起用于加速运行在 Amazon EC2 上的大语言模型推理,并支持跨 NVIDIA GPU 与 AWS Trainium 的组合。随着模型体量越来越大,节点间通信、KV cache 搬运和 GPU 利用率已经成为推理性能瓶颈。AWS 的说法是,这种整合可以提升吞吐量、降低延迟,并更高效地管理 KV cache。
数据处理层面也有新的联合优化。AWS 表示,在 Amazon EMR on EKS 搭配 G7e 实例的方案中,针对 Apache Spark 工作负载可以实现 3 倍加速。对数据工程师和数据科学团队来说,这类优化的意义并不只是“跑得更快”,还意味着特征工程、复杂 ETL 和实时分析能更快完成,从而缩短 AI 模型迭代周期。对于需要把大规模数据处理和 AI 训练、推理串联起来的企业,这会是一个实际的生产效率指标。
在模型服务层,AWS 还预告了两项与 NVIDIA Nemotron 相关的新能力。其一是开发者未来可直接在 Amazon Bedrock 上使用强化微调(Reinforcement Fine-Tuning)来微调 Nemotron 模型;其二是为多代理工作负载设计的混合 MoE 模型 Nemotron 3 Super 也将进入 Bedrock。AWS 把这些能力定位为让开发团队在不自己维护底层基础设施的前提下,完成更贴近行业场景的模型对齐与部署。
更多细节
文章还提到,随着 AI 规模扩大,单位功耗性能不只是可持续发展议题,也直接关系到竞争力。AWS 借 GTC 会议场景强调,其基础设施在能效方面优于本地数据中心,并把这一点与企业级 AI 运行成本联系起来。换句话说,AWS 正试图把“算力更多、更快”与“整体拥有成本更可控”打包成一套面向生产环境的叙事。
从产业竞争角度看,这篇公告并不只是简单列出新品,而是在展示云厂商与芯片厂商如何共同定义下一阶段 AI 基础设施。AWS 和 NVIDIA 希望向市场证明:未来 AI 竞争不仅是模型参数之争,更是 GPU 供给、网络互联、数据处理、托管服务和成本控制的系统能力之争。谁能把这些环节真正整合起来,谁就更有机会承接企业级 AI 的大规模落地。



