AI 尝试攻克一个长达 167 年的数学难题——黎曼猜想,虽然最终未能完全解决,但其研究过程却意外地刷新了一项长达 37 年的数学纪录。
这个诞生于 1859 年的数学猜想,至今仍是数学界的未解之谜,并设有 100 万美元的奖金。Anthropic 公司内部,有人向其尚未发布的 Claude 研究版本提出了一个极具挑战性的任务:“认真尝试一下黎曼猜想。”
Claude 接受了挑战,并展现了其强大的计算能力。它首先提出了 650 个不同的思路,但均未成功。随后,它组织了约 60 个 Claude 子 Agent,耗时一天半,执行了 2400 次 Shell 命令,编写了数百个 Python 脚本,并进行了数千次数值检验。尽管如此,黎曼猜想依然未能被攻克。
然而,在这次尝试中,Claude 取得了一项突破性进展。Anthropic 披露,这个 Claude 研究版本将黎曼 ζ 函数中已知至少位于临界线上的零点比例下界,从之前的 41.6% 提升至 67.2%。这意味着,人类此前能够证明的符合黎曼猜想预测的零点比例,现在已经提高到 67.2%。
Menlo Ventures 的合伙人 Deedy 评价称,Claude 的这一结果“简直离谱”,可能是有史以来解析数论领域最重大的进展之一。他指出,在过去的 37 年里,数学家们仅将这个数字提高了 0.8 个百分点,而 Claude 一口气将其提高了 25.6 个百分点。
Anthropic 的两名数学家随后对 Claude 的论文进行了研究和验证,Claude 还提供了相应的 Lean 形式化证明。数论学家 Brian Conrey 和 Dan Goldston 也对论文进行了审阅。
Anthropic 强调,目前的方法可能无法直接导向黎曼猜想的最终证明。但此次成果发出了一个重要信号:前沿 AI 模型在数学研究领域的能力,已经开始触及那些没有现成答案的难题。
167 年的黎曼猜想未解之谜
黎曼猜想的重要性与其在素数分布中的作用息息相关。1859 年,德国数学家伯恩哈德・黎曼提出,黎曼 ζ 函数的所有“非平凡零点”的实部都应等于 1/2,即所有这些零点都落在复平面上的一条特定直线上——临界线。
这一问题影响深远,许多关于素数分布的数学结论都以黎曼猜想成立为前提。它因此成为克雷数学研究所的七大“千禧年难题”之一,并设有 100 万美元奖金。
尽管百余年来无人能证明所有非平凡零点都落在临界线上,但数学家们已能证明其中一部分零点符合这一条件。因此,一个实际的问题是:至少有多少比例的零点可以被证明位于临界线上?经过数十年的努力,这个比例的已知下界已提升至约 41.6%。Claude 的此次研究,正是针对这个比例进行的推进。
从 41.6% 迈向 67.2%
Claude 取得这一结果并非凭空而来。其研究基础可以追溯到 1973 年数学家 Hugh Montgomery 对 ζ 函数零点分布的研究。近年来,数学家们在相关技术上取得了进一步发展,使得部分方法在不预设黎曼猜想成立的情况下也能使用,从而有机会帮助研究零点在临界线上的比例。Claude 在此基础上,结合了 Enrico Bombieri 在 2000 年左右的相关研究,找到了新的方法。
最终,Claude 得出结论:至少 67.2% 的相关零点位于临界线上,较此前的 41.6% 下界,提高了 25.6 个百分点。
技术层面,Claude 构建了一个合适的函数空间,并利用 Weil 诱导的二次型,将位于临界线上的零点和偏离零点分别对应到正定和负定方向。随后,它利用二次型的秩与一阶、二阶矩信息之间的关系建立了不等式。
Anthropic 的数学家认为,Claude 的关键之处在于,它没有分开处理正定和负定部分,而是将整个空间置于同一框架下进行分析,并且允许二次型具有非对角结构。结合此前数论研究的成果,这一步最终导出了 67.2% 的下界。
需要明确的是,Anthropic 方面并未声称此技术能够直接推导出 100% 的比例,也未表示 Claude 距离证明黎曼猜想仅剩 32.8%。67.2% 只是一个相关问题下界上的改进,与完整证明黎曼猜想仍有巨大理论差距。
Claude 的探索过程:3100 万 Token 与 60 个子 Agent
此次实验的另一个亮点在于 Claude 的问题解决方式。整个过程在两轮 Claude Code 会话中完成,总计消耗约 3100 万输出 Token。
最初,Jarred Sumner 向 Claude 下达了开放式的指令:“认真尝试一下黎曼猜想。” Sumner 本人并非数学家,也没有为 Claude 指定具体的数学路径。
在第一轮尝试中,Claude 生成并测试了约 650 个想法,但均未成功。
在第二轮持续约一天半的尝试中,Claude 升级了策略。它组织了约 60 个子 Agent,将问题分解为多个方向并行探索。这些 Agent 执行了约 2400 次 Shell 命令,编写了数百个 Python 脚本,并对已知的 ζ 函数零点进行了数千次数值检查。不同子 Agent 之间还会互相审阅结果。
据 Anthropic 介绍,Sumner 在此阶段几乎未提供数学指导,主要通过鼓励 Claude “继续”、“再试试”来支持其探索。甚至有说法称,Claude 起初对能否在这一著名开放问题上取得实质性进展持怀疑态度,直到持续探索后,新下界才逐渐浮现。
在得到结果后,Claude 启动了自我验证流程。一些子 Agent 负责检查证明,另一些寻找反例。Claude 还下载了 54 篇 arXiv 论文,以检查是否存在类似结果。随后,它又让独立的 Agent 从头推导了一遍结果。
在确认无明显问题后,Claude 主动建议将结果整理成论文,并明确提出需要寻求真正的数论专家进行人工验证。Anthropic 内部的数学家 Levent Alpöge 和 Ralph Furman 随后对论文进行了研究和验证,并与 Claude 合作完成了 Lean 形式化证明,该证明已通过 Lean 标准验证工具的检查。此外,研究黎曼 ζ 函数的数学家 Brian Conrey 和 Dan Goldston 也审阅了论文。
尽管如此,Anthropic 强调,这与完成传统学术同行评审并形成数学界共识仍有区别。


