9 月 17 日,Anthropic 发布技术报告,披露 Claude 在不到四周时间内优化了 30 多个开源生物分子模型(36 个实现),覆盖结构预测、蛋白质设计、蛋白质语言模型与基因组学。监督者是两名熟悉生物建模、但此前没有推理优化或 GPU kernel 工程经验的研究员。这项工作的特殊之处在于:AI 不是被用来解读实验数据,而是直接参与科学软件的性能工程。
[1][2]报告给出的数字可以分成几层。第一层是速度:在 NVIDIA H100 上,Exact 模式(逐位复现原始输出)让 14 个结构预测模型的前向平均提速 1.6 倍;Fast 模式(允许少量数值精度差异)让 13 个模型平均提速 4.1 倍。单个模型差异很大——Exact 从 1.45 到 7.12 倍、Fast 从 2.91 到 31.07 倍,4 倍是平均值而非承诺。第二层是内存:Claude 写出一个低内存 Big 模式,让单个 8-GPU 节点就能准确预测超过 10,000 token 的分子机器——包括人线粒体复合物 I、TRiC 伴侣复合物、蛋白酶体与细菌核糖体;此前这些规模需要跨节点推理。第三层是 kernel:Claude 开发了可复用的 FlashPairformer v1 GPU kernel,三角形注意力平均比领域标准实现快 2.7 倍。
报告也没有回避边界。团队让 Claude 在单台 8 卡 B300 节点上推理 31,000 到 70,000 token 以上的完整病毒衣壳与蛋白区室——推理跑通了,但结构没有被正确预测。程序能跑,不代表科学上正确;模型在超出训练上下文近两个数量级的尺度上缺乏泛化。这一点报告写得直接。
质量验证是另一个关键段落。在 13 个模型配置、1,925 个模型-靶标对上,所有模式下可接受界面(DockQ 不低于 0.23)的比例变化均小于一个百分点,与默认配置无统计显著差异。需要说明的是,这些基准由 Anthropic 项目内执行,并非独立第三方评估。
最值得注意的经济学实验在末尾:此前 Claude 设计从头蛋白结合物时,每个靶标可花高达 10,000 美元云 GPU(约 2,500 H100 小时);新实验把预算压到单张 H200、24 小时、约 1,100 词 prompt、无子代理无人工干预,16 个靶标的 in silico 得分接近此前 100 倍 GPU 预算的结果。Anthropic 已开源全部优化代码,并联合 Adaptyv Bio 发起蛋白质设计竞赛——5,000 多个设计将进入湿实验验证,配 100 万美元 Claude credits。真正的检验将在那里发生:更快的工具是否真的带来更好的蛋白质。
[1][2]