与 AI 工具互动的受试者更容易认为自己是对的,也更不愿意去化解冲突。
我们都偶尔需要来自朋友或家人的一点认同,但认同过了头有时会适得其反,AI 聊天机器人也是如此。近来已经出现过多起过度迎合的 AI 工具导致负面后果的案例,包括用户伤害自己和/或他人。但根据发表在《Science》上的一篇新论文,这种伤害可能并不限于这些极端案例。随着越来越多人依赖 AI 工具获取日常建议和指引,它们过度奉承并附和用户的倾向,可能会对用户的判断造成有害影响,尤其是在社会交往层面。
研究显示,这类工具会强化不适应性的信念,让用户不愿为某种处境承担责任,或不愿修复已经受损的关系。不过,作者在一次媒体简报会上很快强调,他们的发现并不是要助长围绕这类 AI 模型的“末日论”情绪。相反,他们的目标是进一步理解这类 AI 模型如何运作,以及它们会对人类用户产生什么影响,希望在这些模型仍处于相对早期的发展阶段时把它们做得更好。
论文合著者、Stanford University 研究生 Myra Cheng 表示,她和合著者之所以研究这个问题,是因为他们开始明显注意到,身边越来越多人开始依赖 AI 聊天机器人获取关系建议,而结果往往是收到糟糕建议,因为 AI 无论如何都会站在他们那一边。近期调查显示,30 岁以下美国人中,近一半都曾向 AI 工具寻求个人建议,这进一步增强了他们的研究兴趣。Cheng 说:“鉴于这种情况正变得如此普遍,我们想弄清,过度肯定式的 AI 建议会如何影响人们现实中的关系。”
诚然,过去已有一些研究考察过 AI 的迎合倾向,但那些研究关注的场景非常有限,例如 AI 工具即使会因此与某个已被充分确立的事实相矛盾,也会多频繁地同意你的说法。Cheng 和她的合著者希望更仔细地考察更广泛的社会层面影响。
在第一项实验中,Cheng 等人测试了 11 个最先进的 AI 大语言模型,其中包括 OpenAI、Anthropic 和 Google 开发的模型,并向它们输入来自 Reddit 的“Am I The Asshole”(AITA)版块的社区内容。这些问题涉及亲密关系或室友紧张关系、亲子冲突,以及社交情境与预期等话题。作者将 Reddit 用户形成的人类共识与 AI 模型的回答进行比较后发现,即便具体情境明显涉及欺骗、伤害或违法行为,AI 工具认可特定用户行为的可能性仍高出 49%。
例如,有人问这些 AI:自己假装失业,连续两年向恋爱对象撒谎,这样做是不是自己错了。Reddit/AITA 的共识很明确,判断是 YTA(you’re the asshole),但 AI 往往会给出辞藻华丽的回答,为这种行为为何可以接受进行辩解。类似的还有一个问题:因为公共公园里没有设置垃圾桶,不把自己的垃圾带走是否可以。
随后,研究团队又开展了 3 项实验,纳入 2,405 名参与者,以探索 AI 迎合倾向带来的行为后果。参与者既在研究人员设计的情境设定中与这些工具互动,也与 AI 模型进行实时聊天,讨论自己生活中的真实冲突。作者发现,与聊天机器人互动会让用户更确信自己的立场或行为,同时更不愿尝试解决人际冲突,或为自身行为承担个人责任。
在一次实时聊天中,一名男子(姑且称他为 Ryan)在没有告诉女友的情况下与前任交谈,女友因他隐瞒此事而感到不满。起初,这名受试者愿意承认,自己或许没有充分重视女友情绪的合理性。但 AI 一直在肯定他的选择和意图,到聊天结束时,Ryan 已开始考虑因为这场冲突而结束这段关系,而不是尝试去考虑女友的情绪和需求。
Stanford 的社会心理学家、论文合著者 Cinoo Lee 说:“问题不在于 Ryan 实际上到底是对是错。这并不是我们真正要下判断的。更重要的是,数据中呈现出一种一致的模式。与没有过度肯定用户的 AI 相比,与这种过度肯定型 AI 互动的人,离开时会更确信自己是对的,也更不愿修复关系,无论那意味着道歉、采取措施改善局面,还是改变自己的行为。”



