跳到正文

Amazon Bedrock 中的 Automated Reasoning checks 如何改变生成式 AI 合规

本文介绍 Amazon Bedrock Guardrails 的 Automated Reasoning checks 如何用形式化验证替代概率式校验,在医疗、金融、保险、教育等行业提供可审计、可证明的 AI 合规结果。

功思 AI 编辑部

约 8 分钟读完

Amazon Bedrock 中的 Automated Reasoning checks 如何改变生成式 AI 合规

在受监管行业中,合规团队常常要花数周进行人工审查,支付外部顾问费用,并且在 AI 输出缺乏形式化证明时仍会面临审计缺口。Amazon Bedrock Guardrails 中的 Automated Reasoning checks 通过用数学验证取代概率式 AI 校验来解决这一问题,使 AI 生成的决策转化为可证明正确、可审计的结果。

本文将介绍为什么概率式 AI 校验在受监管行业中存在不足,以及 Automated Reasoning checks 如何利用形式化验证提供经过数学证明的结果。你还将看到六个行业的客户如何使用这项技术产出经过形式化验证、可审计的 AI 输出,以及如何开始使用。

合规挑战

受监管行业面临高风险的合规挑战。医院需要应对辐射安全法规。金融机构需要依据《欧盟 AI 法案》对 AI 风险进行分类。保险公司要回答承保范围问题,而错误回答会带来监管后果。人工审查、高成本顾问和传统流程都无法规模化。

许多构建生成式 AI 或 agentic 解决方案的团队会采用 large language model (LLM)-as-a-judge 模式,即用第二个 LLM 来评估第一个模型的输出。这个方法看似直观,但有一个根本限制:用一个概率式系统去验证另一个概率式系统,无法提供受监管行业所需的形式化、可审计保证。

Automated Reasoning checks 如何依据一组明确的规则与约束提供可证明的合规性

Amazon Bedrock Guardrails 中的 Automated Reasoning checks 采用基于数理逻辑的形式化验证方法,依据一组明确的规则与约束来验证 AI 生成的输出。对于每个请求,你都能得到可证明正确、可审计的评估结果。

看一个例子。某个 AI 助手告诉客户,他们的保险理赔在承保范围内。采用 LLM-as-a-judge 方法时,第二个模型会审核这个答案并表示“看起来没问题”。而使用 Automated Reasoning checks 时,系统会从数学上证明该答案与保单中的每一条规则一致。如果违反了规则,它会准确指出违反的是哪些规则以及原因。

配图

图 1:Automated Reasoning 的分类,包括 Theorem Proving、Type Systems、Model Checking、Abstract Interpretation、Symbolic Execution、SMT Solving 和 SAT Solving。SAT 和 SMT 求解构成 Automated Reasoning checks 的基础。

Automated reasoning 通过开发算法,自动从给定前提中推导出逻辑结论。它建立在数十年的研究基础之上,包括形式化验证(以数学方式证明系统满足其规格)、可满足性求解(判断一个逻辑公式是否可以被满足)以及数理逻辑。

这些相同的基础方法被用于验证硬件设计、证明密码协议的正确性,并精确定位安全关键软件在哪些地方违反了其规格。如今,Automated Reasoning checks 将这些方法应用到了生成式 AI 上。

这些检查将神经网络与逻辑推理结合起来,依据明确规则与约束验证 AI 输出,把概率式响应转化为经过形式化验证、可审计的产物。AWS 将 Automated Reasoning checks 作为多项负责任 AI 工具之一,帮助你保护自己的 AI 应用。

如需详细了解如何配置 Automated Reasoning 策略并查看验证实际运行效果,可参阅《使用 Amazon Bedrock Automated Reasoning checks 减少生成式 AI 幻觉》。

配图

图 2:Amazon Bedrock 中的 Automated Reasoning checks,展示了 4 步流程:Policy Encoding、Output Translation、Formal Verification Engine 和 Result Generation。

行业应用

医疗、金融、能源、保险和教育等行业的组织都在使用 Automated Reasoning checks 来验证 AI 输出,并用可用于审计的证据解释合规决策。

运营工程:Amazon Logistics

Amazon Logistics 团队将工程审查时间从大约 8 小时缩短到几分钟,同时在每一次判定中都获得了正式的合规验证。Amazon Logistics 的 Sustainability Engineering 团队负责在 Amazon 配送站网络中部署 Electric Vehicle Charging Points(EVCPs)。每一份安装提案都需要满足特定地区的法规和内部技术规范。此前,每次审查都需要由领域专家花费约 8 小时手动交叉核对工程参数。

该团队与 AWS 合作,构建了一个由 Automated Reasoning checks 驱动的生成式 AI 辅助设计审查门户。该门户将技术规范转化为 Automated Reasoning 策略,其中包括对变量、类型和条件进行显式定义的精确逻辑规则。它使用形式化数学推理来验证从提案中提取出的工程参数。Amazon Bedrock 中的 Claude 负责文档智能层,从非结构化提案中提取并结构化数据。

“我们的专家仍然是决策者,他们能够完整了解工具如何运作,并且确信每一项建议都可以被追踪、验证和校验。”

- Paula Garcia Carrasco,AMZL 高级可持续发展工程师

现在,领域专家可以把重点放在工程判断上,而不是枯燥的参数匹配。更多信息可参阅 Amazon Logistics 案例研究。

金融服务:Lucid Motors 与 PwC

Lucid Motors 将预测生成时间从数周缩短到不到 1 分钟,并且仅用 10 周就在整个企业内扩展了 14 个 AI 用例。电动汽车制造商 Lucid Motors 与 PwC 和 AWS 合作,构建了一套以 AI 为核心的财务预测与分析解决方案。财务团队面临一个熟悉的挑战:预测周期需要数周的人工工作,限制了他们对快速变化的市场环境作出响应的能力。

PwC 与 AWS 共同在 Amazon Bedrock 上构建了基于机器学习(ML)的预测代理。团队将 Automated Reasoning checks 作为形式化验证层,用数学方式验证模型输出是否遵循预先定义的财务规则和约束。这种方法能够捕捉仅靠概率式 AI 可能遗漏的逻辑不一致。

财务团队如今能够实时参与业务决策,而不必等待数周后才拿到报告。

“Lucid 正与 PwC 和 AWS 一起,把其云环境转变为创新平台……PwC 团队迅速构建了预测工具,将人工工作从数周缩短到不到 1 分钟。”

- Aditya Baheti,Lucid 业务财务负责人

医疗:管理监管复杂性

医疗机构受到严格的监管和安全监督,需要严密的内部控制、文档记录和持续审计。要在临床、运营和安全标准之间确保合规,会给医疗团队带来沉重负担,分散其在核心患者护理活动上的时间和精力。

Fortive 旗下的医疗运营公司专注于通过技术赋能的安全与合规解决方案,帮助客户管理这种复杂性。作为其创新议程的一部分,Fortive 正在评估 AI 驱动的方法如何支持更主动的合规管理,例如 automated reasoning。通过对照要求以确定性方式验证政策,并更早暴露潜在缺口,这些能力有可能在不牺牲严谨性的前提下,简化监督活动、减少人工工作并加快决策。

“评估 automated reasoning 帮助我们更好地理解了它的优势,以及它在哪些类型的挑战中最有价值,使我们从概率式 AI 迈向数学上的确定性。”

- Gaurav Mantro,Fortive 数据科学与 AI 负责人

教育:First Education & Technology Group (FETG) 与 PwC

FETG 将规则设置工作量最多减少了 80%,持续合规开销减少了 50%,响应延迟从 8–13 秒优化到 1.5 秒。MarsLadder AI 学习系统的运营方 First Education & Technology Group(FETG)与 PwC 和 AWS 合作,为面向学生的生成式 AI 构建了一层负责任 AI 治理层。传统审核方法、关键词过滤器和概率式分类器都无法可靠执行 Safer Technologies 4 Schools(ST4S)框架,因为该框架对上下文和意图都有要求。

PwC 将 Automated Reasoning checks 实施为确定性的验证层,把 ST4S 原则转化为 10 条涵盖数据保护和学生安全的形式逻辑规则。在每条 AI 生成的回复到达学习者之前,系统都会先进行验证,用可经数学证明的合规性取代概率式判断。

该解决方案提供了可从数学上证明的合规证据,而这正是教育监管机构为遵循 ST4S 框架所要求的能力。更多信息可参阅 PwC 关于教育领域负责任 AI 的案例研究。

更多行业采用 Automated Reasoning checks

其他受监管行业的组织也在采用 Automated Reasoning checks,以加强合规:

结论

本文介绍了 Amazon Bedrock Guardrails 中的 Automated Reasoning checks 如何提供可从数学上证明的验证,以及可用于审计的证据。对于在受监管行业中构建合规助手,或为现有 AI 工作流加入形式化验证层的团队而言,这项技术提供了一条从概率式信心走向数学证明的路径。

Automated Reasoning checks 还可与 AWS 的其他负责任 AI 能力形成补充,例如用于检索增强生成的 Knowledge Bases for Amazon Bedrock、用于合规跟踪的 AWS Audit Manager,以及用于模型治理的 Amazon SageMaker AI。

准备开始了吗?

如果想讨论 Automated Reasoning checks 如何支持你的合规用例,请联系你的 AWS 账户团队。为此,可先梳理出你最重要的 3 个需要对 AI 输出进行形式化验证的合规工作流。

配图

图 3:使用 Amazon Bedrock Automated Reasoning 进行合规检查的参考架构。

致谢

特别感谢 Suresh Kanan、Tonny Ouma、Laurie Kasper 和 Stefano Buliani 对这项工作的贡献。

Nafi Diallo

Nafi Diallo 是 Amazon Web Services 的高级 Automated Reasoning 架构师,专注于 AI 安全、形式化验证以及面向可信 AI 解决方案的护栏实施。她在评估和提升 Amazon Bedrock 上生成式 AI 与 agentic 系统可靠性方面拥有丰富经验。Nafi 还担任 AWS 内 Women in AI and ML(WAIML)组织北美地区负责人,支持各地分会发展,并推动 WAIML 在整个地区的使命。

Aishwarya Natarajan

Aishwarya Natarajan 是 AWS 驻佐治亚州亚特兰大的解决方案架构师,专注于汽车与制造业,在 Industrial IoT 和 AI/ML 方面具有专业经验。她热衷于帮助客户利用云技术解决各自独特的业务挑战。业余时间,她喜欢与家人朋友相处并探索新地方。

Adewale Akinfaderin

Adewale Akinfaderin 是 Amazon Bedrock 生成式 AI 团队的高级数据科学家,他在 AWS 负责推动基础模型和生成式 AI 应用的发展。他擅长可复现、端到端的 AI/ML 方法、实际落地,以及帮助全球客户针对跨学科问题制定并开发可扩展的解决方案。他拥有两个物理学研究生学位和一个工程学博士学位。

参与讨论

正在确认登录状态…