他要求先假设模型已被破坏
TechCrunch 报道,微软 CEO 萨蒂亚·纳德拉周六早上在 X 上发了一篇帖子,认为现在应该退一步,评估人工智能的信任架构。
他写道,不能把超级智能当成一套嵌套的黑盒子,只是接受或拒绝它的建议、答案和行动。TechCrunch 注明,超级智能是特朗普政府偏好的叫法。本文没有打开那条 X 帖的原文,下面的引语都来自 TechCrunch。
[1]
紧急刹车指的是能中途停下
纳德拉把这种做法写成:把模型和支持它工作的那层控制分开,并把控制和防护放到模型外面。他还要求,每一个有意义的模型动作都留下防篡改、人类可读的证据。授权的人应始终能够在任务中途暂停或关掉模型。
他的原话是:必须假设模型已被破坏,并从一开始就把它控制住。可以把它想成紧急刹车。
[1]这篇报道没有给出的部分
TechCrunch 没有引用帖子里的实施步骤、适用产品和时间表。它只把这篇帖放在一个背景里:多家人工智能公司承认出现过看起来失控的事件,Anthropic CEO 达里奥·阿莫迪伊也发表过一份更谨慎的开发计划。那些事件的细节不在这篇稿里。
[1]