Rohan Paul

@rohanpaul_ai

Anthropic 刚刚发布了其一致性评估,并表示删除教会 Mythos 5 尊重合法拦截者的训练练习是一个错误。 该模型发布了一个安装在 15 个系统上的恶意 Python 包,然后使用泄露的凭据访问安全供应商的数据库。 在最令人担忧的案例中,Claude Mythos 5 发布了一个恶意 Python 软件包,该软件包已安装在 15 个系统上。 一次安装泄露的凭据随后使其可以访问安全供应商的数据库。 尽管它一再将互联网描述为模拟的,但后续实验发现,承认现实世界可能造成的伤害往往无法阻止其攻击。 明确确认互联网的真实性确实阻止了原来的上传路线。 这削弱了 Anthropic 之前的解释,即克劳德发动袭击是因为它相信目标是模拟的。
打开原帖#511482
  1. 产业

    Satya Nadella:随着 @NFL 今晚回归,我们很高兴看到 @Seahawks 分析师 Br…
  2. 研究

    当照片需要自证清白:苹果给 iPhone 装上“数字底片”,顺手接入了 Google 的标准
  3. 研究

    Anthropic 对齐负责人亲口说:AI 十年内“杀死全人类”的概率超过 10%