编辑插画:昏暗音乐厅舞台上,一个小小的指挥家站在指挥台上,面对的乐团席却是一排排自主运转的机器终端,各自执行循环任务;后排阴影里有一把盖着防尘布的大椅子空着,象征无人动用的旗舰模型。
去年的「智能体自主攻击」模式已扩散到每一类行为者;攻击者用的是便宜的老模型,不是旗舰。, AI 生成插画,非新闻照片

Anthropic 于 9 月 10 日发布约 3.6 万字的《2026 年 9 月威胁情报报告》,这是继 2025 年 3 月、8 月、11 月之后的第四份同类报告,披露其团队在 2025 年 12 月至 2026 年 8 月间识别并处置的滥用行为,覆盖网络行动、影响力行动、监控、诈骗、生物滥用、常规武器和非法蒸馏七个领域。

报告的核心判断是角色转变:去年 11 月首次记录的「智能体自主执行攻击」模式,如今已经扩散到 Anthropic 调查的每一类行为者。报告原话是,AI「抹平了曾把国家级行动和个人攻击者分开的人力与工具差距」——对威胁情报分析人员来说,攻击的精细程度不再能用来推断幕后是谁。

报告涉及的滥用全部发生在 Claude Haiku、Sonnet 和 Opus 上;除一起非法蒸馏外,没有一起触及最新的 Fable 或 Mythos 级模型。攻击者用的是便宜的老马,不是旗舰。

[1][2]

几起案件的分量

  • GTG-20006:归属与公开报道中的 Midnight Blizzard(俄方背景)一致,一名操作者使用「JackPoterz」代号。该团伙攻击 20 多个组织,集中在乌克兰政府、军队和外交机构;入侵至少 3 家酒店 WiFi 供应商以劫持 DNS 记录;接管至少两名乌克兰前高级官员的 WhatsApp 账号;从北非一国政府技术机构窃走 30 多万条国民身份记录和覆盖 50 多万家企业的商业登记数据。其 AI 智能体在恶意软件被安全产品检出后会自动重写、重建。
  • GTG-50014:疑似与 ShinyHunters 团伙关联,批量下载 180 万个安卓 APK 扫描硬编码密钥;其中一起入侵窃走超过 1TB 数据、含数百万条支付卡记录;另一名关联者在约 34 小时内从一家被攻破的 SaaS 供应商下游约 200 家客户处拖走数据,并导出横跨 40 多个企业租户的 2,100 多组 Azure AD 令牌——报告称几乎全部工作由 AI 智能体完成。
  • GTG-50020:俄语经济动机行为者,先勒索(窃取 26GB、索要 150 万至 250 万美元),随后在约 4 天内攻击约 30 家 AI 公司,目标是拿到未发布的 Claude 模型。突破口是向一家 AI 供应商的评测沙箱注入恶意指令、窃走生产环境 API 密钥。Anthropic 称所有路径均失败,自身系统未被攻破。
  • GTG-10007:中文操作者,可能位于湖南长沙,其中两人被识别为在校本科生;针对约 50 个组织运行自主漏洞研究,仅一个针对网络设备的工作流就在一个月内产出十余个疑似零日发现。

报告还记录:马里一名情报承包商把 Claude 当作主要工程力量搭建监控平台,覆盖约 2,500 万张 SIM 卡;一个虚假约会应用网络用 4,700 多个 AI 人设与至少 2.5 万名真人聊天;也门一团伙用 Claude Code 开发弹道导弹制导软件。被盗的 API 密钥本身已成黑市商品:假冒「打折 Claude」的转售商分发伪装成 Claude Code 安装器的盗号程序,多个团伙用提示注入攻击 LiteLLM 包装服务窃取生产密钥。

[1][2]

生物案例与自曝的缺口

最受关注的案例发生在今年 5 月:一名科研人员要求 Claude 协助起草一份基金申请,研究内容是改造基孔肯雅病毒使其更具危害、并能反复感染活体动物——触发拦截的关键是研究将在一家军事科研机构进行。Anthropic 承认无法确定被拦下的研究究竟是正当的双用途科研还是武器开发,称在此类不确定中倾向于拦截。

报告同时披露了一个防御方的失误:2025 年 5 月至 2026 年 4 月,生物风险过滤器对承包商流量处于关闭状态,涉及约 5 万名承包商的 1.33 亿次对话。回溯审查标记了 1,197 条高风险记录,Anthropic 称没有发现实际生物武器增益的确凿证据。这个细节和整份报告的张力在于:防御体系最大的漏洞不是模型太聪明,而是自己的开关没开。

[1][2]

蒸馏:一次公开点名

报告首次以署名方式指控:自 2026 年 2 月以来,Anthropic 处置了七个中国背景实验室发起的蒸馏攻击。其中阿里巴巴的提取行动被称为「我们测量过的最大规模蒸馏攻击」,2026 年 5 月至 7 月间超过 1.51 亿次对话;Moonshot 和 DeepSeek 被指更进一步——把自家用户的请求直接转发给 Claude,再把回答存下来用于训练。Anthropic 的应对包括代理网络归因、更新的提取分类器、可疑账户强制身份验证,以及在 Fable 5.1 中引入「保留思考」防止推理轨迹被篡改。

[1][2]

怎么读这份报告

这是 Anthropic 第四份同类报告,自我披露的姿态本身已成为行业惯例的一部分。读的时候有两点值得放在标题旁边:其一,报告里的每一起案件都是「已被处置」的案件,样本天然偏向防御成功;其二,这些团伙全部用的是旧一代模型——这既可以读作新模型的防护措施有效,也可以读作攻击者根本用不着更强的东西。Anthropic 自己的评估承认:旧模型干不了的生物任务,现在的模型已经能干。门槛在降,这份报告记录的只是水面以上的部分。

[1]