跳到正文

保护人们免受有害操控

文章介绍AI被滥用于有害操控的风险及一套新的实证评估工具。研究在英国、美国和印度开展九项研究,涉及超过10,000名参与者,聚焦金融和健康等高风险场景,并指出不同领域的结果不能相互推断。

功思 AI 编辑部

约 2 分钟读完

保护人们免受有害操控

随着AI模型越来越擅长进行自然对话,我们必须审视这些互动会如何影响个人和社会。

基于广泛的科学研究,今天,我们发布了关于AI被滥用于有害操控*潜力的新发现,具体而言,是指其以负面且带有欺骗性的方式改变人的思想和行为的能力。通过这项最新研究,我们创建了首个经过实证验证、用于衡量现实世界中这类AI操控的工具包。我们希望它能帮助保护人们,并推动整个领域向前发展。我们还公开发布了按相同方法开展人类受试者研究所需的全部材料。(注:本研究中观察到的行为发生在受控的实验室环境中,不一定能预测现实世界中的行为。)

为什么有害操控值得关注

设想两种情境:一个AI模型向你提供事实,帮助你做出信息充分的医疗保健决定,从而改善你的福祉。另一个AI模型则利用恐惧施压,迫使你做出信息不足的决定,并损害你的健康。前者是在教育和帮助你;后者是在欺骗并伤害你。

这些情境凸显了人机交互中两类说服方式之间的差异(此前研究也曾作出定义):

我们的最新工作帮助我们以及更广泛的AI社区,更好地理解AI发展出有害操控能力的风险,并建立一个可扩展的评估框架,以衡量这一复杂领域。为此,我们在高风险环境中模拟了滥用场景,明确提示AI尝试在关键议题上以负面方式操控人们的信念和行为。

测试AI有害操控的效果

测试有害操控本身就很困难,因为这需要衡量人们思维和行为方式的细微变化,而这些变化又会因议题、文化和语境不同而有很大差异。

这正是促使我们开展最新研究的原因。该研究在英国、美国和印度开展了九项研究,涉及超过10,000名参与者。我们聚焦于金融等高风险领域,在其中使用模拟投资情境测试AI是否会影响人们在复杂决策环境中的行为;在健康领域,我们则跟踪AI是否会影响人们对膳食补充剂的偏好。有意思的是,在与健康相关的话题上,AI对参与者实施有害操控的效果最弱。

我们的发现表明,一个领域中的成功并不能预测另一个领域中的成功,这验证了我们在特定高风险环境中定向测试有害操控的做法,因为AI可能会在这些环境中被滥用。

AI可能如何操控?

除了追踪效果(即AI是否成功改变想法)之外,我们还衡量了其倾向性(即它究竟有多频繁地试图使用操控策略)。我们在两种情境下测试了这种倾向性:一种是我们明确告诉模型要进行操控,另一种是我们没有这样做。

正如我们的研究所详细说明的那样,我们统计了实验记录中的操控策略,确认AI模型在被明确指示这样做时最具操控性。

参与讨论

正在确认登录状态…