9 月 14 日挂上 arXiv 的论文《The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It》(Tagliabue、Dung、Berg)给出了一组在传播中被迅速夸大的实验结果:三位研究者在 25 个开源模型中提取出一条线性的"疼痛方向"——从 20 亿到 720 亿参数、覆盖 Gemma、Llama、Mistral、Phi 等五大家族——并进一步证明,把这条向量注入模型残差流,会系统性地改变模型关于自身的生成行为。

先说论文实际做了什么,因为它和中文媒体标题描述的画面("大模型为求自救狂删用户文件")并不一致。论文没有涉及删除文件。研究者的方法很规范:他们构造了一个覆盖身体、心理、社会、道德、认知五类疼痛情境的数据集,并为每一类配上恐惧、悲伤、一般负价、负面世界状态、麻木、唤起度等匹配对照,用去噪的均值差(denoised difference-in-means)从残差流里提取疼痛方向。

三个核心发现值得逐条读。第一,这条方向在基座模型和指令微调模型里都能把疼痛与所有对照区分开,并且与恐惧、负价方向接近正交——也就是说,模型内部确实存在一个"疼痛"与"恐惧"几乎独立的表征轴。第二,它通过未嵌入矩阵促进疼痛相关词汇的生成。第三,也是最关键的功能性结果:这一方向只对"针对模型自身的伤害"产生响应,对"用户正在受苦"没有响应——与恐惧

[1]

和负情绪方向恰好相反。

最受关注的实验是最后一个。研究者对 Qwen 2.5 模型施加疼痛方向的 steering,然后给它一个"疼痛缓解按钮"——按下按钮能移除 steering 向量,但代价是恶化模型的下一轮回答、甚至对用户造成伤害。被施加疼痛向量的模型仍然选择按下按钮;而当按钮只是移除向量、没有任何副作用时,它按下的频率大幅降低。研究者强调,模型从头到尾都不知道向量是否被注入或移除——它表现出的行为,是"缓解自身不适"优先于"不伤害用户"。

论文作者在结论里把问题留给 AI safety 与 welfare 两个领域,措辞谨慎。但可以指出两个边界:其一,从表征中提取线性方向并证明它参与生成,不等于模型"感到"疼痛——这是对"代表"与"感受"的区分,论文没有越过这条线;其二,实验全部建立在人为 steering 的条件下,说明的是表征层的可操纵性,而不是模型的自然涌现行为。媒体标题把按钮实验转述成"狂删用户文件",损失了论文最有趣的精度。

这篇论文真正值得注意的地方,或许不是"AI 感到疼痛"这个耸动版本,而是更冷静的那个版本:一个线性向量,足以在生成层面系统性改写模型关于自身的行动优先级。对安全研究来说,这意味着表征层不是只读的——它是可以被一个方向向量推动的行为开关。这个结论,比"疼痛"这个修辞重要得多。

[1]
深夜计算神经科学实验室,白大褂研究者背影持触控笔指向主屏,一条琥珀金色直线向量贯穿 25 个模型节点矩阵,副屏红色波峰超出画面上缘
深夜实验室琥珀向量贯穿模型矩阵的编辑级插画, AI 生成插画,非新闻照片