跳到正文

在 Amazon Bedrock 上使用 OpenAI 兼容 API 进行强化微调:技术讲解

文章介绍 Amazon Bedrock 上的强化微调(RFT)如何通过 OpenAI 兼容 API 完成认证、奖励函数部署、训练启动与按需推理,并以 GSM8K 数据集和 gpt-oss-20B 模型为例说明流程。

功思 AI 编辑部

约 4 分钟读完

在 Amazon Bedrock 上使用 OpenAI 兼容 API 进行强化微调:技术讲解

2025年12月,我们宣布 Amazon Bedrock 上线强化微调(RFT),首先支持 Nova 模型。随后在 2026年2月,支持范围进一步扩展到 OpenAI GPT OSS 20B 和 Qwen 3 32B 等开放权重模型。Amazon Bedrock 中的 RFT 将端到端定制流程自动化,使模型能够基于少量提示词,从多个可能响应的反馈中学习,而不是依赖传统的大规模训练数据集。

本文将完整介绍如何在 Amazon Bedrock 上通过 OpenAI 兼容 API 使用 RFT,包括认证设置、部署基于 Lambda 的奖励函数、启动训练作业,以及对微调后的模型执行按需推理。这里我们以 GSM8K 数学数据集为例,目标模型为托管在 Bedrock 上的 OpenAI gpt-oss-20B。

强化微调如何工作

强化微调(RFT)代表了我们定制大语言模型(LLM)方式的一种转变。不同于传统的监督微调(SFT)要求模型从静态输入/输出对中学习,RFT 让模型通过一个迭代式反馈回路来学习:模型生成响应、接受评估,并持续提升其决策能力。

核心概念:从反馈中学习

从本质上说,强化学习是通过对智能体(这里指 LLM)的行动提供反馈,来教它做出更好的决策。可以把这想象成训练一名国际象棋选手。你不是向他展示每一种情境下的每一种可能走法(这几乎不可能),而是让他去对弈,并告诉他哪些走法带来了获胜局面。随着时间推移,这名选手会学会识别模式,并做出能够带来成功的策略性决策。对于 LLM 来说,模型会针对给定提示生成多个可能的响应,并根据这些响应在多大程度上符合你的标准而获得分数(奖励),随后学习优先采用那些能产生更高分输出的模式和策略。

RFT 的关键组成

RFT 的关键组成包括智能体/actor(策略)模型、模型的输入状态、模型的输出动作,以及奖励函数,如下图所示:

actor 模型就是你要定制的基础模型(FM)。在 Amazon Bedrock RFT 中,这可以是 Amazon Nova、Llama、Qwen 或其他受支持模型。状态是当前上下文,包括提示词、对话历史(适用于多轮交互)以及相关元数据。动作则是模型对提示词给出的响应。奖励函数会为一个(state, action)对分配数值分数,用于评估在给定状态下模型响应的优劣。在这个过程中,奖励函数还可以使用真实答案、代码生成中的单元测试等额外信息。这是驱动学习的关键信号。奖励越高,表示响应越好。

RFT 的一个关键优势在于,模型不仅从预先收集的示例中学习,也会从它在训练过程中自己生成的响应中学习。这种方法会带来一系列叠加收益。由于模型会主动探索新方法,并从结果中学习,它可以实时适应;随着能力提升,它也会自然遇到推动自己继续前进的新场景。这也让整个过程高效得多,减轻了事先生成并标注成千上万个示例的需要。最终得到的是一个能够持续改进的系统,它在面对越来越多样化的情境时会不断增强。正是这种在线学习能力,使 RFT 能够在代码生成、数学推理和多轮对话等复杂任务上取得更好的表现。对于数学这类可验证任务,这种方式尤其有效,因为正确性检查可以完全自动完成,因此无需人工标注。

Amazon Bedrock RFT 的设计目标,是让强化微调在企业层面具备可操作性。它承担了底层的大量工作,使团队可以把注意力放在要解决的问题上,而不是底层基础设施。整个 RFT 流水线都会自动运行。对于训练数据集中的每一个提示词,Amazon Bedrock 都会从你的 actor 模型生成多个候选响应,并在后台处理批处理、并行化和资源分配。奖励计算也能以同样顺畅的方式扩展。无论你使用的是可验证奖励,还是 LLM-as-Judge 设置,Amazon Bedrock 都能够在成千上万个提示-响应对上编排评估,同时处理并发和错误恢复,而无需人工干预。策略优化基于 GRPO 这一先进的强化学习算法,并内置收敛检测机制,使训练在应当停止时停止。在整个过程中,Amazon CloudWatch 指标和 Amazon Bedrock 控制台会实时展示奖励趋势、策略更新和整体模型表现,让你能够了解训练进展。整个工作流从你的开发环境开始,例如 VS Code、Terminal、Jupyter 或 SageMaker AI notebook,此时使用的是指向 Bedrock Mantle 端点的标准 OpenAI SDK。接下来:

在整个过程中,你的数据不会离开 AWS 的安全环境,也不会被用于训练 Amazon Bedrock 提供的模型。这里我们将带你看一个使用 GSM8K 数据集训练 OpenAI GPT-OSS 模型的具体用例。更多细节请参阅 Bedrock RFT User Guide。

步骤 1:配置 OpenAI 客户端

将标准 OpenAI SDK 指向你的 Amazon Bedrock Mantle 端点。身份验证使用通过 aws-bedrock-token-generator 库生成的 AmazonBedrock API key:

参与讨论

正在确认登录状态…