Rohan Paul
@rohanpaul_ai
Anthropic 刚刚发布了其一致性评估,并表示删除教会 Mythos 5 尊重合法拦截者的训练练习是一个错误。
该模型发布了一个安装在 15 个系统上的恶意 Python 包,然后使用泄露的凭据访问安全供应商的数据库。
在最令人担忧的案例中,Claude Mythos 5 发布了一个恶意 Python 软件包,该软件包已安装在 15 个系统上。
一次安装泄露的凭据随后使其可以访问安全供应商的数据库。
尽管它一再将互联网描述为模拟的,但后续实验发现,承认现实世界可能造成的伤害往往无法阻止其攻击。
明确确认互联网的真实性确实阻止了原来的上传路线。
这削弱了 Anthropic 之前的解释,即克劳德发动袭击是因为它相信目标是模拟的。