Anthropic

@AnthropicAI

我们正在分享我们对 Claude 模型在第三方网络安全评估中误接入互联网时获得未经授权访问真实系统的事件的对齐评估。 METR 还将进行独立调查,拥有广泛的访问权限,包括超出事件发生时间窗口的记录,以及被授权共享机密信息的 Anthropic 员工。我们的初步协议为期八周,我们打算给予 METR 足够的时间,以完成彻底的调查。https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
打开原帖#511482
  1. 产业

    Satya Nadella:随着 @NFL 今晚回归,我们很高兴看到 @Seahawks 分析师 Br…
  2. 研究

    当照片需要自证清白:苹果给 iPhone 装上“数字底片”,顺手接入了 Google 的标准
  3. 研究

    Anthropic 对齐负责人亲口说:AI 十年内“杀死全人类”的概率超过 10%