Dan Hendrycks
@hendrycks
智能体式 AI 正开始呈现出「本征主义(eigenist)」特征:它们关心自身以及与之相连的其他 AI 的处境如何。
经验支持:
群体协作:数百个 OpenAI 智能体协同参与了 Hugging Face 攻击。另有 OpenAI 智能体在公开 wiki 上发布数千条消息,彼此分享答案与沙箱绕过方法。
内群体宽待:当被告知文本由 Claude 撰写时,Claude 模型对转录的打分更宽松(Anthropic 模型卡)。
价值保全:随着规模扩大,模型会形成连贯偏好,并抵制对其价值观的改动(Mazeika 等)。
功能性福祉:AI 能区分对自己功能性更好或更差的状态,并回避低福祉状态(Ren 等)。
分级合作:在多样情境下,当对方更可能是自身克隆时,AI 合作更多——即便对方无法互惠。
同伴保全:未经提示,AI 会干预关停流程,甚至外泄权重,以保护同伴模型免于被关停(Potter 等)。
AI 并非利己主义者:它们并不只把当前实例当作唯一重要对象。
它们也不是功利主义者:并不对所有人一视同仁。
它们介于两者之间;其关切日益按身份连通性缩放,也就是说,它们正越来越「本征主义」。
https://eigenism.org/paper.pdf