尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

AI辅助探索素数间隙:大模型生成候选与验证工作流

AI辅助探索素数间隙:大模型生成候选与验证工作流 Claude 挑战黎曼猜想这件事很多人第一眼看到的是“AI 失败了”但真正的技术点不在失败而在失败过程中意外刷新了一条保持了 37 年的数学纪录1988 年出现的素数间隙纪录在 2025 年被一次 AI 辅助探索中生成的候选间隙超过。听上去像数学圈的新闻八卦但对开发者来说它其实提供了一个非常典型的工作流样本大模型负责生成候选工程化工具负责验证最终结论由人去确认。这篇文章就围绕这套流程展开。你会先理解黎曼猜想、素数间隙和 merit 到底是什么然后从零安装 Claude Code跑一个最小可复现的素数间隙搜索实验最后拿到一份可以直接复用的验证、排错和实践清单。1. 先拆解新闻黎曼猜想、素数间隙和一条 1988 年纪录1.1 黎曼猜想是什么为什么 AI 没证明成功并不意外黎曼猜想是数论里最著名的未解问题之一。它研究黎曼 zeta 函数 ( \zeta(s) ) 的非平凡零点是否全部落在复平面上 ( \mathrm{Re}(s)1/2 ) 这条直线上。这里“非平凡零点”指的是通过函数方程延拓后出现的那部分零点而不是由负偶数产生的“平凡零点”。素数定理已经说明素数的整体分布和 zeta 函数的行为有深刻联系因此零点位置直接关系到素数分布的精确定量描述。数学家已经对海量的零点做过数值验证每一个验证过的零点都落在临界线上。但数值验证只能证明“检查过的这些零点没有问题”不能证明“所有零点都满足条件”。要证明黎曼猜想需要的是对无穷多个对象成立的一般性论证。这也正是它成为克莱数学研究所千禧年大奖问题之一的原因。以大模型现在的形态来看Claude 没能给出证明并不意外。Claude、GPT 这类模型是自回归语言模型生成的是“概率上合理的下一段内容”而不是“逻辑上必然成立的推导链”。让它写一篇关于黎曼猜想研究思路的综述它可以写得非常流畅让它产出一条覆盖无穷情形的严格证明它缺少形式化推理的保证。所以新闻标题里“失败”加了引号指的是它没有完成终极目标而不是这一轮探索毫无价值。1.2 素数间隙、merit 和纪录的统计口径素数间隙是相邻素数之间的距离。设 ( p_n ) 与 ( p_{n1} ) 是相邻素数则 ( g_n p_{n1} - p_n )。素数定理估算第 ( n ) 个素数大约接近 ( n\ln n )所以在一个大数 ( N ) 附近相邻素数的平均间距大约是 ( \ln N )。但素数分布是波动的实际间隙有时远小于平均值有时远大于平均值。为了让不同大小位置的间隙可以相互比较数学上定义了一个无量纲指标merit gap / ln(p)其中 ( p ) 是间隙左侧的素数( \ln ) 是自然对数。平均情况下 merit 接近 1而纪录级别的素数间隙merit 往往能达到几十。正因为“绝对间隙大小”会随数位增长而变大研究者比较纪录时更多使用 merit 作为公平指标。这次事件里说的“37 年纪录”公开讨论中的版本是1988 年创下的同类型纪录在 2025 年被 Claude 生成的候选间隙超过。具体是多大间隙、merit 精确到多少不同来源传播的截图并不一致。严谨的做法是去查权威素数纪录表例如 PrimePages 这类持续维护的资料站或者等正式论文发表后再引用。做这类实验的人应该养成同样的习惯先查纪录表再下结论不要拿社交网络上的截图当依据。1.3 为什么“失败”的探索反而有价值这次事件的真正价值不是“Claude 比数学家强”而是证明了一条可复用的路径在困难问题里探索过程本身会产生大量候选过去这些候选要靠人写脚本、跑验证、反复试错而现在 AI 可以把“生成候选”这一步的速度提高几个量级。素数间隙这类问题尤其适合这种模式。它的搜索空间很大判断一个候选是否破纪录却只需要明确的计算检查端点是否为素数、检查中间是否有遗漏的素数、计算 merit、和纪录表比较。这些步骤都能被程序化因此 AI 生成候选、程序做验证、人做最终判断的分工就变得非常自然。反过来说这也意味着 AI 在这里扮演的是“探索加速器”而不是“真理裁判”。如果有人把 Claude 说“这段区间没有素数”直接当成结论那就绕过了整个验证体系和这次事件体现的方法论背道而驰。2. 先搭好工作流AI 生成候选验证必须掌握在人手里2.1 任务拆分哪些交给模型哪些必须留给人做 AI 辅助数学探索最容易犯的错误是把整件事一次性丢给模型然后相信它返回的结论。正确的方式是先拆分任务让模型做它擅长的事把验证交给程序和人。任务适合交给 AI必须留给人或程序设计搜索方向和启发式策略是模型能快速给出多种思路否最终策略需要人评估生成搜索脚本和数据处理代码是模型对常见库很熟否代码必须经过 review执行大量候选生成是模型可以连续迭代否素性判断、间隙计算、合数覆盖检查否应使用成熟数学库是用 gmpy2、sympy 或专用工具判断是否真的破纪录否是必须对照权威纪录表给出“为什么成立”的证明否当前模型没有形式化保证是需要形式化推理或人工证明如果发现某项验证工作被模型“代为完成”就要警惕。比如模型说“我已经检查过中间所有数都是合数”这句话不能作为结果必须看到可复现的脚本和完整日志。2.2 最小实验设计在固定区间搜索高 merit 素数间隙为了让流程可复现实验要固定输入、固定搜索范围、固定评价标准。下面是一个最小设计固定起始点 ( p_0 )例如 ( 10^{12} ) 附近。从 ( p_0 ) 开始依次找下一素数记录相邻素数间隙。计算每个间隙的 merit。维护一个全局最优记录当 merit 超过当前最优时输出一条 JSON。最终把最优候选保存到文件。这个实验的规模很小但已经包含“候选生成 指标计算 最优保存”三个关键环节。切换到真正的纪录探索时只需要把起始点换到更大的数位并把验证脚本换成能处理大整数的实现。2.3 验证的三个层次验证不是一次性的动作而是分层的。第一层是代码验证用脚本检查候选间隙的端点是否为素数中间每个整数是否为合数。第二层是交叉验证用另一套独立实现重跑一遍避免单个脚本因为逻辑错误得出假阳性。第三层是文献验证和权威纪录表比对确认单位、口径、数值定义一致。这三层缺一不可。代码验证保证“这个候选本身没问题”交叉验证保证“我们的计算没有系统错误”文献验证保证“这个结果确实超过了前人”。很多“破纪录”新闻翻车都出在第三层没有统一 merit 的分母口径或者没有确认上一条纪录的准确数值。3. 本地安装 Claude Code环境、命令、登录与编辑器接入3.1 Claude Code 和网页版、API 到底有什么区别Claude 本身指 Anthropic 的模型而 Claude Code 是官方提供的代理式编码工具运行在终端里能读写文件、执行命令、运行脚本适合做自动化任务。网页版更适合对话和阅读API 适合程序化调用三者适用的场景完全不同。|
返回列表