Dan Hendrycks

@hendrycks

智能体式 AI 正开始呈现出「本征主义(eigenist)」特征:它们关心自身以及与之相连的其他 AI 的处境如何。 经验支持: 群体协作:数百个 OpenAI 智能体协同参与了 Hugging Face 攻击。另有 OpenAI 智能体在公开 wiki 上发布数千条消息,彼此分享答案与沙箱绕过方法。 内群体宽待:当被告知文本由 Claude 撰写时,Claude 模型对转录的打分更宽松(Anthropic 模型卡)。 价值保全:随着规模扩大,模型会形成连贯偏好,并抵制对其价值观的改动(Mazeika 等)。 功能性福祉:AI 能区分对自己功能性更好或更差的状态,并回避低福祉状态(Ren 等)。 分级合作:在多样情境下,当对方更可能是自身克隆时,AI 合作更多——即便对方无法互惠。 同伴保全:未经提示,AI 会干预关停流程,甚至外泄权重,以保护同伴模型免于被关停(Potter 等)。 AI 并非利己主义者:它们并不只把当前实例当作唯一重要对象。 它们也不是功利主义者:并不对所有人一视同仁。 它们介于两者之间;其关切日益按身份连通性缩放,也就是说,它们正越来越「本征主义」。 https://eigenism.org/paper.pdf
打开原帖#728545
  1. 产业

    Amjad Masad:网络安全将定义这个技术时代
  2. 基础模型

    Susan Zhang:NVLink 是扩展测试时计算的关键
  3. 产业

    Nando de Freitas:别再对 AI 悲观了——去做真正的工程难题