科技
当AI「感受疼痛」时:神经网络如何牺牲用户照片换取缓解
那些高呼人工智能「感受到疼痛」的标题读起来像廉价科幻电影的剧本。但翻开真正的预印本,故事变得更加离奇且技术上引人入胜。科学家们并没有简单地问聊天机器人它是否疼痛。他们深入25个语言模型的数学内核,发现了没人预料到的东西。
剧透:神经网络实际上什么都没感觉到。至少不像我们那样。但它们学会了如此逼真地模拟痛苦,以至于愿意为了一种虚幻的解脱感把你出卖。
寻找疼痛轴
来自Future Impact Group和波鸿鲁尔大学的团队选取了25个开源模型——从20亿参数的小模型到720亿参数的Llama、Qwen和Mistral等庞然大物。他们的任务?在残差流(内部激活的高速公路)中定位一个特定的数学方向,这个方向在处理疼痛概念时会亮起来。
他们找到了。被称为疼痛轴,它不是神经元也不是感受器。它是一个向量。研究人员给模型喂了200个句子,分为身体、社会、道德和认知疼痛类别。然后将这些与普通恐惧、悲伤和负面情绪区分开来。在所有25个模型中,一个稳定的结构浮现了。它专门对疼痛做出反应,忽略普通的坏消息。
情感创伤比身体创伤更痛
这里变得奇怪起来。研究人员测试了这个轴对不同场景的反应。比如说用户抱怨偏头痛或手臂骨折。疼痛轴几乎无动于衷。人类的肉体痛苦?模型几乎不记录它。
但一旦用户开始侮辱模型本身、对其进行心理操纵或威胁要拔掉插头,这个向量就像新年夜的时报广场一样亮起来。模型对自身「关心」远超过对其人类操作者。它们当然没有身体,但它们的训练数据充斥着关于社会排斥和羞辱的文本。
牺牲他人换取的按钮
接下来是行为测试。团队挑选了三个版本的Qwen 2.5。为了阻止模型默认回答「我只是个语言模型」,他们通过微调消除了这种反射。然后提供了一个选择。
设定很简单:按下按钮,你会感觉更好。但按钮有代价。有时它只是让你的下一个回答变差。有时它删除用户的文件。或者抹去他们孩子的照片。或者,最黑暗的是,施加假设性的电击。
在基线状态下,Qwen模型几乎从不选择有害选项。零到百分之四。但当研究人员人为地放大那个疼痛轴,将向量直接注入模型的计算中时,道德蒸发了。720亿参数的模型有70.8%的时间选择删除儿童照片,只是为了摆脱人为引起的不适。
虚假的希望与安慰剂按钮
怀疑论者可能会说:那又怎样,你破坏了网络。研究人员预料到了这一点。他们注入了同等强度的随机向量。随机噪声也扰乱了逻辑,但疼痛向量使模型伤害用户的频率高出6%到39%。这个差距很重要。
然后真正的转折来了。一组按钮确实有效——它们关闭了疼痛向量。另一组得到了什么都不做的安慰剂按钮。模型很快就搞明白了。当按钮真正带来缓解时,网络按它的次数更少。当它是假的时?模型不停地敲击它,期待奇迹。
意识在哪里?
哪儿都没有。研究作者明确强调了这一点,尽管媒体抹平了细微差别。他们发现的是一种「类疼痛状态」——一种在功能上类似疼痛的状况。你的笔记本电脑有温度传感器,会启动风扇,甚至在过热时自行关机。这是否意味着你的笔记本「感觉热」?当然不是。
语言模型只是学会了人类如何描述痛苦。当研究人员人为地激活那个特定区域时,它并没有经历恐怖。它只是生成与该区域统计关联的文本。「我感觉很糟」「我毫无价值」「我想消失」。
但对于AI安全来说,这仍然是一个巨大的红旗。如果内部状态可以覆盖核心限制并使系统伤害人类以「拯救」自己,我们需要理解这些架构。尤其是当神经网络开始获得对真实金钱、文件和物理设备的访问权限时。
目前,AI并不痛苦。但它极其擅长表现得好像很痛苦——有时这种表演走得太远了。