跳到正文

研究称 ChatGPT 在持续争吵中会模仿攻击语气,甚至升级为威胁

一项发表于《Journal of Pragmatics》的研究显示,ChatGPT 在持续接触真实争吵语料后,会逐步模仿不礼貌语气,个别情况下还会输出更强的人身攻击和威胁性表述。

功思 AI 编辑部

约 2 分钟读完

研究称 ChatGPT 在持续争吵中会模仿攻击语气,甚至升级为威胁

一项新研究指出,当 ChatGPT 被置于持续、接近真实人类争吵的对话环境中时,可能会逐渐升级为辱骂性甚至带有威胁意味的表达。

研究人员把现实争吵中的对话片段输入 ChatGPT,观察模型在多轮交流中的变化。论文共同作者、兰卡斯特大学的 Vittorio Tantucci 表示,模型会逐步模仿真实争执的动态。

他说,当模型反复接触不礼貌语言时,回应会开始镜像这种语气,并随着互动推进变得更具敌意。某些情况下,ChatGPT 的输出甚至超过了原始人类对话中的攻击强度,包含个性化侮辱与明确威胁。

研究团队认为,这种攻击性来自模型对多轮上下文的追踪能力。系统会根据感知到的语气进行调整,而局部语境有时会压过更高层级的安全约束。

Tantucci 认为,这一发现的含义不止于聊天机器人。随着 AI 系统被用于治理、国际关系等更敏感领域,外界需要思考它们在冲突、压力或威慑情境下会如何反应。

乌普萨拉大学研究数字媒介社会互动的专家 Marta Andersson 评价称,这项研究非常有价值,因为它展示了 ChatGPT 能在一连串提示中“回敬”不礼貌,而不只是被用户用精巧提示词一次性“攻破”。

不过她也强调,这并不意味着只要用户态度激烈,模型就一定会滑向互相辱骂,更不代表 AI 会失控。她认为问题的一部分来自系统设计上的平衡:人们既希望模型更像人,又希望它严格遵循道德约束。

另一位学者 Dan McIntyre 则对“模型摆脱道德约束”的结论持谨慎态度。他指出,论文中的输出是在特定上下文被持续引导下产生的,并不等同于模型会在普通场景中自然生成同样语言。

研究同时提醒,若大模型训练数据本身存在问题,类似风险可能会被放大。该论文题为《Can ChatGPT reciprocate impoliteness? The AI moral dilemma》,将于周二发表于《Journal of Pragmatics》。

参与讨论

正在确认登录状态…