黎明数学书桌:黑板上的临界线零点、笔记本电脑与一叠 arXiv 预印本
配图:冲着大猜想,在可检验的邻近命题上留下痕迹, AI 生成配图,非新闻照片

黎曼假设悬了百余年,Anthropic 员工 Jarred Sumner(非数学家)却给 Claude 丢下一句:Take a real stab at the Riemann hypothesis。8 月 10 日的研究说明里,官方坦承假设本身没被攻克;意外收获是:未发布研究版 Claude 把“有多少零点落在临界线上”的已知下界,从长期停留的 41.6% 推到 67.2%,并写出可供专家审读的论证与 Lean 形式化尝试。

[1]

过程被写得很具体。第一轮生成并尝试约 650 个想法,全军覆没;第二轮用一天半调度约 60 个子代理,跑约 2400 条 shell、写数百个 Python 脚本,对照已知 zeta 零点做数值检查并互相审稿。人类输入大多是“继续”“相信自己”一类鼓励。Claude 自行从 arXiv 下载 54 篇论文查重,要求人类数论学者复核。Anthropic 数学家 Levent Alpöge 与 Ralph Furman 审读;领域专家 Brian Conrey 与 Dan Goldston 也在短时间内查看了论文。技术路径被描述为结合 Aryan、Baluyot–Goldston–Suriajaya–Turnage-Butterbaugh 与 Bombieri 等既有工作,在允许非对角二次型的函数空间上推出新不等式。全程约 3100 万输出 token。

[1]

官方自己划线:不期望这些技术通向黎曼假设的证明。真正新鲜的是“打偏靶”的能力——冲着不可能的大目标,在相邻可检验命题上留下可审计进展。鼓励性提示被承认可能帮助模型克服“AI 不该碰开放难题”的自我设限;这既是有趣的产品观察,也是对齐研究者会皱眉的地方:外部激励能否系统改变探索勇气?作者判断:价值在可复核的边界推进,不在标题党式的“AI 证明了黎曼”。

[1]

对数学共同体,41.6%→67.2% 若经得起持续审查,会成为工具链讨论的硬例子;对实验室,它展示了子代理分工(约 2 个出关键想法、13 个贡献、13 个校验、2 个写初稿)的科研编排模板。争议在于:未发布模型 + 鼓励提示,可复现性弱于开放权重实验;公众容易把相关下界误读成假设已被解决。Anthropic 选择公开非正式说明、专家审读与更新后的论文版本(8 月 13 日修订),是在主动降温。

[1]

与后来的 FLT 形式化相比,这篇更像一次“走错门推开了侧窗”。收束:衡量数学 agent 的标准,应从“是否撞开圣杯”改成“在可检验的邻近命题上,能否留下专家愿意签字的增量”。

[1]