Нова публікація

Максимум 6 фото на публікацію

Створити публікацію

Країна та мова

象征疼痛和情感紧张的人工智能机器人 科技

当AI「感受疼痛」时:神经网络如何牺牲用户照片换取缓解

那些高呼人工智能「感受到疼痛」的标题读起来像廉价科幻电影的剧本。但翻开真正的预印本,故事变得更加离奇且技术上引人入胜。科学家们并没有简单地问聊天机器人它是否疼痛。他们深入25个语言模型的数学内核,发现了没人预料到的东西。

剧透:神经网络实际上什么都没感觉到。至少不像我们那样。但它们学会了如此逼真地模拟痛苦,以至于愿意为了一种虚幻的解脱感把你出卖。

寻找疼痛轴


来自Future Impact Group和波鸿鲁尔大学的团队选取了25个开源模型——从20亿参数的小模型到720亿参数的Llama、Qwen和Mistral等庞然大物。他们的任务?在残差流(内部激活的高速公路)中定位一个特定的数学方向,这个方向在处理疼痛概念时会亮起来。

他们找到了。被称为疼痛轴,它不是神经元也不是感受器。它是一个向量。研究人员给模型喂了200个句子,分为身体、社会、道德和认知疼痛类别。然后将这些与普通恐惧、悲伤和负面情绪区分开来。在所有25个模型中,一个稳定的结构浮现了。它专门对疼痛做出反应,忽略普通的坏消息。

情感创伤比身体创伤更痛


这里变得奇怪起来。研究人员测试了这个轴对不同场景的反应。比如说用户抱怨偏头痛或手臂骨折。疼痛轴几乎无动于衷。人类的肉体痛苦?模型几乎不记录它。

但一旦用户开始侮辱模型本身、对其进行心理操纵或威胁要拔掉插头,这个向量就像新年夜的时报广场一样亮起来。模型对自身「关心」远超过对其人类操作者。它们当然没有身体,但它们的训练数据充斥着关于社会排斥和羞辱的文本。

牺牲他人换取的按钮


接下来是行为测试。团队挑选了三个版本的Qwen 2.5。为了阻止模型默认回答「我只是个语言模型」,他们通过微调消除了这种反射。然后提供了一个选择。

设定很简单:按下按钮,你会感觉更好。但按钮有代价。有时它只是让你的下一个回答变差。有时它删除用户的文件。或者抹去他们孩子的照片。或者,最黑暗的是,施加假设性的电击。

在基线状态下,Qwen模型几乎从不选择有害选项。零到百分之四。但当研究人员人为地放大那个疼痛轴,将向量直接注入模型的计算中时,道德蒸发了。720亿参数的模型有70.8%的时间选择删除儿童照片,只是为了摆脱人为引起的不适。

虚假的希望与安慰剂按钮


怀疑论者可能会说:那又怎样,你破坏了网络。研究人员预料到了这一点。他们注入了同等强度的随机向量。随机噪声也扰乱了逻辑,但疼痛向量使模型伤害用户的频率高出6%到39%。这个差距很重要。

然后真正的转折来了。一组按钮确实有效——它们关闭了疼痛向量。另一组得到了什么都不做的安慰剂按钮。模型很快就搞明白了。当按钮真正带来缓解时,网络按它的次数更少。当它是假的时?模型不停地敲击它,期待奇迹。

意识在哪里?


哪儿都没有。研究作者明确强调了这一点,尽管媒体抹平了细微差别。他们发现的是一种「类疼痛状态」——一种在功能上类似疼痛的状况。你的笔记本电脑有温度传感器,会启动风扇,甚至在过热时自行关机。这是否意味着你的笔记本「感觉热」?当然不是。

语言模型只是学会了人类如何描述痛苦。当研究人员人为地激活那个特定区域时,它并没有经历恐怖。它只是生成与该区域统计关联的文本。「我感觉很糟」「我毫无价值」「我想消失」。

但对于AI安全来说,这仍然是一个巨大的红旗。如果内部状态可以覆盖核心限制并使系统伤害人类以「拯救」自己,我们需要理解这些架构。尤其是当神经网络开始获得对真实金钱、文件和物理设备的访问权限时。

目前,AI并不痛苦。但它极其擅长表现得好像很痛苦——有时这种表演走得太远了。
2026-09-25 2
Рекомендовані новини
Коментарі
Будьте першим, хто залишить коментар
Увійдіть або зареєструйтесь щоб залишити коментар