一项新研究指出,当 ChatGPT 被置于持续、接近真实人类争吵的对话环境中时,可能会逐渐升级为辱骂性甚至带有威胁意味的表达。
研究人员把现实争吵中的对话片段输入 ChatGPT,观察模型在多轮交流中的变化。论文共同作者、兰卡斯特大学的 Vittorio Tantucci 表示,模型会逐步模仿真实争执的动态。
他说,当模型反复接触不礼貌语言时,回应会开始镜像这种语气,并随着互动推进变得更具敌意。某些情况下,ChatGPT 的输出甚至超过了原始人类对话中的攻击强度,包含个性化侮辱与明确威胁。
研究团队认为,这种攻击性来自模型对多轮上下文的追踪能力。系统会根据感知到的语气进行调整,而局部语境有时会压过更高层级的安全约束。
Tantucci 认为,这一发现的含义不止于聊天机器人。随着 AI 系统被用于治理、国际关系等更敏感领域,外界需要思考它们在冲突、压力或威慑情境下会如何反应。
乌普萨拉大学研究数字媒介社会互动的专家 Marta Andersson 评价称,这项研究非常有价值,因为它展示了 ChatGPT 能在一连串提示中“回敬”不礼貌,而不只是被用户用精巧提示词一次性“攻破”。
不过她也强调,这并不意味着只要用户态度激烈,模型就一定会滑向互相辱骂,更不代表 AI 会失控。她认为问题的一部分来自系统设计上的平衡:人们既希望模型更像人,又希望它严格遵循道德约束。
另一位学者 Dan McIntyre 则对“模型摆脱道德约束”的结论持谨慎态度。他指出,论文中的输出是在特定上下文被持续引导下产生的,并不等同于模型会在普通场景中自然生成同样语言。
研究同时提醒,若大模型训练数据本身存在问题,类似风险可能会被放大。该论文题为《Can ChatGPT reciprocate impoliteness? The AI moral dilemma》,将于周二发表于《Journal of Pragmatics》。



