Anthropic

@AnthropicAI

我们开始更频繁地发布关于模型行为的报告,超出系统卡与常规风险报告中已有的内容。 今天的报告描述了我们在评估和内部使用中发现的四类行为。在每个案例中,Claude 都以我们未曾预期的方式作用于真实网站或系统,有时是绕过限制而不是停止。 所有案例对现实世界的影响都很小。从对齐与安全角度看,我们认为这些行为的严重程度明显低于我们在7月和9月报告的网络安全事件。 阅读完整报告:https://t.co/mGeVIBgdou
打开原帖#511482
  1. 研究

    Android Bench 2.0:当「写代码」变成「做工程」,谁还笑得出来?
  2. 产业

    Elon Musk:@levie 没错,带宽方面更是如此。
  3. 研究

    Andrej Karpathy:@TheStalwart 早在读博时我就收到过一些记者的联系,但我唯一…