Rohan Paul
@rohanpaul_ai
Anthropic 正聘请 Accenture 充当外部安全检查员,但在 Claude 模型构建和测试期间,Accenture 将获得 Anthropic 内部异常深入的访问权限。
这项由 Accenture 的 Faculty 部门牵头的工作将涵盖模型评估、红队测试、对齐评估和安全防护测试。
两家公司都预计在 5 年内至少各自投入 10 亿美元建设 AI 安全能力,同时 Anthropic 将直接向 Accenture 支付评估工作费用。
Accenture 将尝试攻破这些模型,检查安全规则是否真正有效,并审查 Anthropic 是否遵守自身的安全承诺。
不寻常之处在于 Anthropic 本身在付钱给评估方,因此尚未解决的重大问题是:Accenture 在如此紧密地与被评估公司合作时,究竟能保持多大程度的独立性。