跳到正文

Amazon Nova Forge 展示数据混合微调路线,兼顾专业能力与通用性

AWS 在 Nova Forge SDK 系列文章中详细演示了如何微调 Amazon Nova 模型,并通过数据混合尽量保住基础模型的通用能力。

功思 AI 编辑部

约 1 分钟读完

Amazon Nova Forge 展示数据混合微调路线,兼顾专业能力与通用性

AWS 在 Nova Forge SDK 系列第二篇文章中,把重点放在一个很现实的问题上:企业想让模型更懂自己的业务数据,但又不希望一微调就把原本的通用能力丢掉。Nova Forge 给出的核心方法,是在训练时把客户自己的数据与 Amazon 策划的数据集混合使用。

文章引用此前实验的结果称,在一个覆盖 1,420 个叶子类别的 Voice of Customer 分类任务上,这种数据混合方法让 F1 提升了 12 个点,同时尽量保住了接近基线的 MMLU 表现;而仅用客户数据去微调开源模型,则会明显削弱通用能力。

从数据准备到训练评估的完整流程

这篇实践文档从环境准备开始,覆盖 HyperPod CLI、Nova Forge SDK 的安装、S3 存储配置,再到训练和评估的全过程。为了演示领域化微调,AWS 选用了 Hugging Face 上公开的 MedReason 医疗推理数据集,规模约 3.27 万组问答。

SDK 还会对训练样本进行 token 级校验,避免训练数据中出现和模型内部聊天模板冲突的字符串,例如字面量的 System: 或 Assistant:。文章建议通过插入空格或清理保留标记的方式,减少训练信号被误读的风险。

高成本门槛仍然存在

AWS 也没有回避成本问题。示例训练和评估使用了 4 台 `ml.p5.48xlarge` 实例,这属于高端 GPU 资源,因此它建议先用 `max_steps=5` 做小规模验证,再决定是否进行完整训练。

从路线图来看,Nova Forge 的意义不只是提供一套 SDK,而是把“如何在不伤害基础能力的前提下做垂直微调”包装成一条更标准化的工程流程。对希望在自有数据上定制基础模型的企业来说,这类工具链会越来越重要。

参与讨论

正在确认登录状态…