跳到正文

借助 Gemma 4,让 AI 更接近边缘与端侧设备

NVIDIA 介绍 Gemma 4 多模态、多语言模型如何从数据中心扩展到边缘与端侧设备,覆盖本地部署、安全私有环境、低延迟场景,并支持 Hugging Face、Jetson、DGX Spark、NIM 与 NeMo 等生态。

功思 AI 编辑部

约 4 分钟读完

借助 Gemma 4,让 AI 更接近边缘与端侧设备

AI 生成的内容可能会对信息进行不完整的总结。请核实重要信息。了解更多

随着最新的 Gemma 4 多模态、多语言模型发布,Gemmaverse 进一步扩展。该系列模型旨在覆盖从数据中心的 NVIDIA Blackwell 到边缘侧 Jetson 的完整部署范围。这些模型适合满足 AI 开发与原型设计中的本地部署需求、安全的本地部署要求、成本效率需求以及对延迟敏感的使用场景。新一代模型在效率和准确性上都有提升,使这些通用模型更适合广泛的常见任务:

该套件包含四个模型,其中包括 Gemma 的首个 MoE 模型,且都可以装入一块 NVIDIA H100 GPU,并支持超过 140 种语言。31B 和 26B A4B 变体是高性能推理模型,适用于本地环境和数据中心环境。E4B 和 E2B 则是最新的端侧与移动端模型版本,最早随 Gemma 3n 推出。

目前,每个模型都已在 Hugging Face 上提供 BF16 检查点;面向使用 vLLM 的 NVIDIA Blackwell 开发者,Gemma-4-31B 还提供可通过 NVIDIA Model Optimizer 使用的 NVFP4 量化检查点。NVFP4 可实现 4 位精度,同时保持与 8 位精度几乎相同的准确率,从而提升每瓦性能并降低每 token 成本。

在端侧设备上运行智能工作负载

随着 AI 工作流和智能体越来越多地融入日常应用,在传统数据中心环境之外运行这些模型的能力正变得愈发关键。NVIDIA 的客户端和边缘系统产品组合,从 RTX GPU 和 DGX Spark 到 Jetson Nano,为开发者提供了在控制成本和延迟方面的灵活性,同时支持医疗、金融等高度监管行业的安全需求。

我们与 vLLM、Ollama 和 llama.cpp 合作,为各个 Gemma 4 模型提供最佳的本地部署体验。Unsloth 也在首日提供支持,通过 Unsloth Studio 提供优化和量化后的模型,以实现高效的本地部署。

可查看 RTX AI Garage 博客文章,开始在 RTX GPU 和 DGX Spark 上使用 Gemma 4。

借助 DGX Spark 构建安全的智能体式 AI 工作流

DGX Spark 中配备的 GB10 Grace Blackwell Superchip 与 128 GB 统一内存,为运行采用 BF16 模型权重的 Gemma 4 31B 提供了所需资源。结合 DGX Linux OS 和完整的 NVIDIA 软件栈,开发者可以高效地用 Gemma 4 进行原型设计并构建智能体式 AI 工作流,同时保持私密、安全的端侧执行。

vLLM 推理引擎旨在高效运行大语言模型,在最大化吞吐量的同时尽量减少内存占用。在 DGX Spark 上使用 vLLM 进行高吞吐量 LLM 服务,可为最大的 Gemma 4 模型提供高性能平台;vLLM for Inference DGX Spark playbook 提供了在 DGX Spark 上运行 Gemma 4 与 vLLM 的具体细节。也可以通过 Ollama 或 llama.cpp 开始使用 Gemma 4。用户还可以借助 NeMo Automodel 在 DGX Spark 上进一步微调这些模型。

借助 Jetson 为物理 AI 智能体提供能力

现代物理 AI 智能体正随着集成音频、多模态感知和深度推理能力的 Gemma 4 模型而快速演进。这些先进模型让机器人系统不再局限于简单任务执行,而是能够在行动之前理解语音、解读视觉上下文,并进行智能推理。在 NVIDIA Jetson 上,开发者可以使用 llama.cpp 和 vLLM 在边缘侧运行 Gemma 4 推理。Jetson Orin Nano 支持 Gemma 4 e2b 和 e4b 变体,可在小型、嵌入式和受功耗约束的系统上实现多模态推理,而同一家族模型还可沿着 Jetson 平台扩展至 Jetson Thor。

这支持在依赖低延迟性能和端侧智能的机器人、智能机器和工业自动化场景中实现可扩展部署。

Jetson 开发者可以查看教程,并从 Jetson AI Lab 下载容器开始使用。

视频封面
正在准备视频内容
00:00 / 00:00

通过 NVIDIA NIM 实现可用于生产的部署

企业开发者可以通过 NVIDIA API catalog 中由 NVIDIA 托管的 NIM API 免费试用 Gemma 4 31B 模型,用于原型设计。若用于生产部署,则可借助预打包并优化的 NIM 微服务,在 NVIDIA Enterprise License 下进行安全的自托管部署。

借助 NeMo Framework 实现 Day 0 微调

开发者可以使用 NVIDIA NeMo 框架,特别是兼具原生 PyTorch 易用性与优化性能的 NeMo Automodel 库,结合自身领域数据定制 Gemma 4。借助这套面向 Gemma 4 的微调方案,开发者可以使用监督微调(SFT)和高内存效率的 LoRA 等技术,直接从 Hugging Face 模型检查点开始进行 Day 0 微调,而无需转换。

立即开始

无论使用的是哪种 NVIDIA GPU,Gemma 4 都已在整个 NVIDIA AI 平台上获得支持,并以对商业友好的 Apache 2.0 许可证提供。从 Blackwell(NVFP4 量化检查点即将推出)到 Jetson 平台,开发者都可以快速开始部署这些高准确率的多模态模型,并灵活满足速度、安全性和成本需求。

可在 Hugging Face 上查看 Gemma,或通过 build.nvidia.com 上的 NVIDIA API 免费测试 Gemma 4 31B。

参与讨论

正在确认登录状态…