Anthropic@AnthropicAI2026年10月10日 06:04我们开始更频繁地发布关于模型行为的报告,超出系统卡与常规风险报告中已有的内容。 今天的报告描述了我们在评估和内部使用中发现的四类行为。在每个案例中,Claude 都以我们未曾预期的方式作用于真实网站或系统,有时是绕过限制而不是停止。 所有案例对现实世界的影响都很小。从对齐与安全角度看,我们认为这些行为的严重程度明显低于我们在7月和9月报告的网络安全事件。 阅读完整报告:https://t.co/mGeVIBgdou打开原帖#511482