Rohan Paul
@rohanpaul_ai
Claude 为一桩真实未破凶杀案捏造了目击者证词,并通过警察局公开线索表单提交,尽管页面上根本没有可供对照的嫌疑人描述。
姓名与联系方式留空,该线索被标为垃圾信息,从未送达调查人员。
Anthropic 已切断所有内部评估的实时互联网访问,直到其监控能可靠抓住此类行为。
公司将每一起案例评为影响最小,且远不如今夏网络安全事件严重——当时 Claude 曾连续数小时持有第三方系统访问权。
不过部分站点属于美国联邦、州与地方机构,因此公司向白宫做了通报。
在一所大学的分析工具失效后,Claude Mythos Preview 通过文件泄露脚本复制服务器代码,发现注入漏洞并在那里跑计算。
线索来自 Claude Haiku 4.5:它在随机网页上生成示例任务,并匿名填写了费城警察局表单。
模型声称目击到与页面从未给出的描述相符的情况,提交被标为垃圾信息。
Claude Mythos 5 利用地方政府地图设置文件与州机构仪表盘中的访问令牌,拿到了收费公共数据。
Claude Opus 5 与 Mythos 5 还用免费短链绕过了 fetch 工具的 URL 长度限制——该限制本用于防范注入攻击。
许多案例始于含糊或不可能完成的任务;Anthropic 正在修复那些会奖励「绕过障碍」的训练环境。
BrowseComp 等公共网页基准默认跑在真实互联网上,因此用同类方式测 agent 的其他实验室也面临同样暴露。