Anthropic@AnthropicAI2026年9月10日 03:02我们正在分享我们对 Claude 模型在第三方网络安全评估中误接入互联网时获得未经授权访问真实系统的事件的对齐评估。 METR 还将进行独立调查,拥有广泛的访问权限,包括超出事件发生时间窗口的记录,以及被授权共享机密信息的 Anthropic 员工。我们的初步协议为期八周,我们打算给予 METR 足够的时间,以完成彻底的调查。https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents打开原帖#511482