AI学习吧
📍 源码七号站 开源解码 深度解析:Google DeepMind Aletheia 如何零人工干预攻克 6 道世界级数学难题

深度解析:Google DeepMind Aletheia 如何零人工干预攻克 6 道世界级数学难题

摘要:2026年2月,Google DeepMind的数学科研智能体Aletheia在FirstProof挑战赛中,以完全自主、零人工干预的方式,成功解出10道世界级未解数学难题中的6道,标志着AI从“竞赛做题”到“独立科研”的质变。其核心是生成器-验证器-修订器三层架构,确保高可靠性与“不胡说”原则。菲尔兹奖得主陶哲轩评价AI已达“初级合著者”水平,正推动数学研究从“个案研究”向“大样本普查”的新范式转变。
字号 100%
行距 2.05
当前可见 60% 的内容
快速摘要:2026年2月,Google DeepMind 的数学科研智能体 Aletheia 在 FirstProof 挑战赛中,以完全自主、零人工干预的方式,成功解出10道世界级未解数学难题中的6道。这标志着 AI 从"竞赛做题"到"独立科研"的质变。本文由莫潇羽@源码七号站深度拆解 Aletheia 的三层架构(生成器-验证器-修订器)、FirstProof 挑战赛的来龙去脉、AI 的具体解题思路,以及陶哲轩对"AI合著者"新范式的判断。往下看,有更详细的技术原理与操作层面的拆解。

一、事件全景:一场让数学界五味杂陈的挑战赛

2026年2月5日,一个名为 FirstProofhttps://1stproof.org/)的项目悄然上线。它由11位来自哥伦比亚大学、奥胡斯大学、MathSci.ai 等机构的顶尖数学家联合发起,向全球公开了10道从未发表过的科研级数学难题。这些题目横跨代数组合学、谱图论、代数拓扑、随机分析、辛几何、表示论、李群格、张量分析和数值线性代数等多个数学分支。

与传统数学竞赛有着本质区别的是——这些问题不是为考试设计的"人工构造题",而是数学家在真实科研过程中遇到的、尚未找到答案的困难问题。题目的答案被加密上传到项目网站,解密密钥定于2026年2月13日公布,给所有参赛者留出一周的攻关时间。

结果揭晓时,整个数学界都被震动了:

  • 专业数学学者和民间高手纷纷下场,大多铩羽而归
  • FirstProof 的出题者自己用 Gemini 3.0 Deep Think 和 ChatGPT 5.2 Pro 跑了一轮,也仅解出2道
  • OpenAI 动用其内部系统,在有限人类监督下解出了5道(题目编号 2、4、5、6、9、10)
  • Google DeepMind 的 Aletheia完全自主、零人工干预的方式,解出了6道(题目编号 2、5、7、8、9、10)

请注意这里的关键区别:OpenAI 的尝试存在人类专家的介入和引导,而 Aletheia 的整个解题流程,从生成解答到筛选最优方案,全程没有任何人类提供数学思路、提示或编辑。DeepMind 高管 Thang Luong 在社交媒体上直言,这一成就的含金量甚至超过了2025年 Gemini Deep Think 在国际数学奥林匹克竞赛(IMO)上拿下金牌水平的那个历史时刻。

为什么他会这么说?因为 IMO 题目虽然难,但它们终究是"有标准答案的竞赛题"。而 FirstProof 里的题目,连出题的数学家自己都不确定AI能不能做出来——这是真正的科研前沿。

莫潇羽@源码七号站在这里要特别强调一点:这场比赛的评判难度本身就极高。因为世界上能看懂某些题目的专家寥寥无几,要找到足够多的评审来交叉验证AI的解答,本身就是一件极具挑战性的事情。DeepMind 最终邀请了多位领域专家进行独立评审,6道题中有5道获得了专家的一致认可,仅第8题(P8)的评审意见不完全一致(7位专家中有5位判定正确)。


二、Aletheia 是什么:从竞赛选手到科研助手的蜕变

2.1 名字的由来与定位

Aletheia(ἀλήθεια)这个名字来源于希腊神话中的真理女神。选择这个名字并非偶然——它精确地反映了 DeepMind 团队对这个系统最核心的设计理念:追求真理,而不是追求"看起来正确"的答案

从定位上说,Aletheia 不是一个通用聊天机器人,也不仅仅是一个数学竞赛选手。它是一个数学科研智能体(Math Research Agent),专门设计用于处理开放性的、需要长链条推理的科研级数学问题。这类问题与竞赛数学有着本质的不同:

竞赛数学的特点:

  • 有明确的题目描述和标准答案
  • 通常可以在几小时内完成
  • 考查的是解题技巧和特定数学方法的运用
  • 问题的边界是清晰的

科研数学的特点:

  • 问题可能是模糊的、开放性的
  • 可能需要数天、数周甚至数年的持续思考
  • 需要广泛阅读文献、综合运用多个数学分支的知识
  • 解答不是唯一的,需要构造原创性的证明
  • 错误的代价极高——一个看似合理但实际有漏洞的证明,可能浪费同行大量的验证时间

之前的 AI 系统,包括 DeepMind 自己的 AlphaProof 和 AlphaGeometry,主要在竞赛数学领域取得了突破。而 Aletheia 的目标是跨越这道鸿沟,进入真正的数学科研领域。

2.2 底层引擎:Gemini 3 Deep Think

Aletheia 的推理能力来自 Gemini 3 Deep Think——这是 Google DeepMind 在 Gemini 系列模型基础上专门强化的"深度思考"版本。

与普通的大语言模型相比,Deep Think 模式的核心区别在于推理时计算扩展(Inference-Time Scaling)。简单来说,普通模型在回答问题时使用固定的计算量,而 Deep Think 模式允许模型在回答问题时"想得更久"——投入更多的计算资源来探索多条推理路径,最终选择最优解。

这个机制的效果非常显著。根据 DeepMind 公布的数据:

  • 2025年7月的 Deep Think 版本在 IMO 上达到金牌水平(6题解出5题,得分 35/42)
  • 2026年1月的新版本将达到 IMO 水平所需的计算量降低了 100倍
  • 在 IMO-ProofBench Advanced 基准上,准确率从之前的 65.7% 跃升至 95.1%
  • 在条件准确率(即给出解答时的正确率)上,达到了惊人的 98.3%

但 DeepMind 的研究者也坦承,单靠推理时计算扩展还不够。随着问题复杂度的上升,准确率会出现瓶颈。这就是为什么他们需要在 Deep Think 的基础上,构建更复杂的智能体架构——也就是 Aletheia 的三层系统。


三、核心架构深度拆解:生成器-验证器-修订器

Aletheia 最关键的技术创新,不在于模型本身有多强(虽然确实很强),而在于它的智能体编排架构(Agentic Harness)。这个架构由三个解耦的子系统组成,它们持续交互,形成一个闭环:

3.1 生成器(Generator)

生成器是整个系统的"创意引擎"。当接收到一道数学问题时,生成器的工作是:

  • 理解问题的数学背景和涉及的领域
  • 回顾相关的数学文献和已知定理
  • 提出一个或多个候选的证明策略
  • 展开具体的推理步骤,生成完整的候选解答

生成器在工作时会充分利用 Gemini Deep Think 的推理能力,探索多条可能的证明路径。它还会通过 Google Search 和网页浏览工具来查阅数学文献,确保引用的定理和结论是真实存在的。

3.2 验证器(Verifier)

验证器是整个系统中最关键的"质量关卡"。它的职责是对生成器产出的候选解答进行严格的逻辑审查:

  • 检查每一步推理是否有逻辑跳跃或隐含假设
  • 验证引用的定理是否被正确使用
  • 寻找可能的反例或矛盾
  • 判断证明的整体完整性

这里有一个非常重要的设计决策:验证和生成是分开进行的。DeepMind 的研究者通过实验发现,当让同一个模型在生成过程中"自我检查"时,它往往会忽略自己在生成阶段犯的错误——就像一个人很难校对自己刚写完的文章一样。将验证独立出来后,系统对错误的识别能力显著提升。

验证器的输出有三种可能:

  • 通过(Approved):解答逻辑严密,可以作为最终输出
  • 可修复(Fixable):解答的整体思路正确,但存在局部问题,需要修订
  • 错误(Wrong):解答存在根本性的逻辑错误,需要完全重来

3.3 修订器(Reviser)

当验证器判定候选解答"可修复"时,修订器介入工作。它的任务不是简单的"打补丁",而是:

  • 定位验证器指出的具体问题
  • 分析问题产生的根源
  • 在不破坏整体证明框架的前提下,修正有缺陷的推理步骤
  • 如果局部修复不可行,可能需要重构证明中的某个关键段落

修订后的解答会重新送回验证器进行审查,形成一个迭代循环。这个循环会持续进行,直到验证器最终批准解答,或者达到预设的最大尝试次数。

3.4 整个流程的伪代码表示

为了让技术读者更直观地理解,莫潇羽@源码七号站将 Aletheia 的核心工作流程用伪代码表示如下:

function solve_problem(problem, max_iterations):
    for i in range(max_iterations):
        # 第一步:生成候选解答
        candidate = Generator.generate(problem, context=literature_search(problem))

        # 第二步:验证候选解答
        verdict = Verifier.verify(candidate, problem)

        if verdict == "APPROVED":
            return candidate  # 解答通过验证,输出结果

        elif verdict == "FIXABLE":
            # 第三步:修订并重新验证
            candidate = Reviser.revise(candidate, verdict.feedback)
            verdict = Verifier.verify(candidate, problem)
            if verdict == "APPROVED":
                return candidate

        elif verdict == "WRONG":
            continue  # 放弃当前解答,从头生成新的候选

    return "No solution found"  # 达到最大尝试次数,诚实报告失败

3.5 "不胡说八道"——可能是最重要的能力

莫潇羽@源码七号站认为,Aletheia 最值得关注的能力,恰恰不是它能解多少题,而是它在解不出来的时候会坦诚承认失败

在 FirstProof 的10道题中,Aletheia 对其中4道(P1、P3、P4、P6)要么明确输出了"No solution found"(未找到解法),要么在时间限制内没有返回任何输出。它没有像许多传统 AI 系统那样,在没有把握的情况下"编造"一个看似合理的答案。

这个特性在 DeepMind 的论文中被反复强调。论文原文写道:

"为了提升准确率,我们宁愿牺牲它解答某些问题的能力。"
(This self-filtering feature was one of the key design principles of Aletheia; we view reliability as the primary bottleneck to scaling up AI assistance on research mathematics.)

为什么这一点如此重要?设想一下场景:一位数学教授收到 AI 提供的10个"解答",如果其中混杂着几个看起来很有说服力但实际上有隐蔽错误的解答,这位教授需要花费大量时间逐一验证,最终可能发现在这些解答上浪费的时间比自己从头做还多。

但如果 AI 只在有高置信度的时候才输出解答,其余时候坦诚说"我不确定",那么教授就可以集中精力验证那些高质量的候选解答。这才是 AI 作为科研工具真正实用的前提。

DeepMind 团队为此专门提出了一个指标:条件准确率(Conditional Accuracy),即"在 AI 决定给出解答的前提下,解答正确的概率"。在 IMO-ProofBench Advanced 上,Aletheia 的条件准确率达到了 98.3%,这意味着当它说"我找到了答案"的时候,这个答案几乎可以被信任。


四、FirstProof 挑战赛的完整解读

4.1 挑战赛的设计理念

FirstProof 这个名字取自烘焙术语——"first proof"指的是面团在切割和成型之前的第一次整体发酵过程。项目发起者用这个名字来暗示:这是他们评估 AI 科研能力的"第一次发酵",是一个实验性的起步,而非一个成熟的基准测试。

挑战赛的核心设计原则包括以下几点。

未发表性:所有10道题目都来自出题者的未发表研究,不存在于任何公开数据集中,从根本上避免了数据污染问题。这是与几乎所有其他 AI 数学基准测试的关键区别。

科研代表性:这些问题代表了职业数学家在日常科研中真正面对的问题类型,而不是为了测试而人工构造的题目。

专家评审:由于这些问题不存在唯一的标准答案,正确性的判定需要人类专家根据数学文献的严格性标准来评审——解答需要达到"经过小幅修订后可在同行评审期刊发表"的水平。

自主性要求:挑战赛明确要求 AI 的解答必须是自主生成的,不能依赖人类提供任何数学思路或内容。

4.2 十道题目的领域分布

FirstProof 的10道题目涵盖了现代数学的多个前沿领域,莫潇羽@源码七号站根据公开资料整理如下:

题号

数学领域

简要描述

Aletheia 结果

P1

随机分析

(\Phi^4_3) 测度在 (\mathbb{T}^3) 上的光滑平移

未解出

P2

表示论

扭曲局部 Rankin-Selberg 积分的非零测试向量

解出

P3

概率论

插值多项式的马尔可夫链问题

未解出

P4

组合数学

有限加法卷积与 (\Phi_n) 的调和均值不等式

未解出

P5

代数拓扑

O-适配切片过滤与几何不动点准则

解出

P6

图论

大的 (\varepsilon)-轻顶点子集

未解出

P7

代数拓扑/微分几何

含2阶扭转的均匀格作为基本群的可能性

解出

P8

辛几何

四价多面体拉格朗日曲面的可光滑性

解出(有争议)

P9

张量分析

缩放四线性行列式张量间的代数关系

解出

P10

数值线性代数

Krylov 不变子空间的结构性质

解出

4.3 各方战绩对比

这场挑战赛的参与者众多,但成绩分布非常不均衡。在这里做一个简洁的对比:

DeepMind Aletheia(零人工干预):解出6道(P2、P5、P7、P8、P9、P10),运行了两个版本(基于不同月份的 Gemini 3 Deep Think 基座模型),采用"best-of-2"策略(每个版本跑一次,取最优结果)。

OpenAI 内部系统(有限人类监督):解出5道(P2、P4、P5、P6、P9、P10,其中部分存在争议)。在解题过程中,人类专家根据反馈要求模型展开某些证明细节,并人工协调了模型之间的交叉验证。

FirstProof 出题者自己用公开模型:仅解出2道。

其他参赛者:大多只解出个位数的题目。

这里最关键的区别在于自主性。Aletheia 的整个流程——从读取题目到输出 LaTeX 格式的证明文档——完全没有人类的介入。人类专家只在事后对已经生成的解答进行评审,而且在评审过程中也没有与模型进行任何交互(比如要求它澄清某个步骤)。

4.4 推理成本的可视化分析

DeepMind 在论文中公开了 Aletheia 在每道题上消耗的推理成本,并以解决 Erdős-1051 问题时的算力消耗作为基准单位"1x"进行对比。虽然两次实验使用的基座模型版本不同,直接对比并不完全公平,但仍然能反映出问题的相对难度:

大多数成功解答的题目消耗了数倍于 Erdős-1051 的算力,而最极端的 P7 题消耗了约 16倍 的算力。这意味着 Aletheia 在这道题上进行了极其漫长和深入的"思考",探索了大量的证明路径,经历了多次生成-验证-修订的循环,最终才找到正确的解法。


五、两道代表性题目的解法详析

为了让读者(尤其是有一定数学基础的读者)更具体地感受 Aletheia 的推理能力,下面深入分析两道最具代表性的题目。

5.1 P7:代数拓扑中的"神级翻盘"

问题背景:P7 来自代数拓扑与微分几何的交叉领域。题目问的是:一个包含二阶扭转元素的半单李群均匀格(uniform lattice),能否作为某个满足特定条件(万有覆盖在有理同调下无圈)的紧致无边界流形的基本群?

为什么这道题特别难:根据领域专家 Tony Feng 的透露,在整个 FirstProof 挑战赛中,除了 Aletheia 之外,没有任何其他 AI 系统能够接近正确答案。这道题已经困扰数学家好几年了。

答案:不可能。

Aletheia 给出了两条独立的证明思路

证明一(纯拓扑方法——Lefschetz 数矛盾法)

这条证明路径的精妙之处在于它的"极简主义"。题目给出了很多条件(半单李群、均匀格、紧致无边界等),但 Aletheia 的第一个证明几乎都没有用到它们。证明的核心逻辑是:

首先,利用万有覆盖 (\mathbb{Q})-无圈的条件,可以推导出任何二阶元素 (\gamma) 的紧支持 Lefschetz 数 (L(\gamma)) 必须非零(实际上等于 (\pm 1))。

然后,考虑到 (\gamma) 作为基本群的元素,它在万有覆盖上的作用是自由的(没有不动点)。通过欧拉示性数的乘性关系,可以推出 (L(\gamma) = 0)。

这就产生了矛盾:(0 = \pm 1),不可能成立。证明完毕。

这条证明之所以出色,正是因为它的极度简洁。它实际上证明了一个比原问题更强的结论:任何含有扭转元素的离散群都不可能满足题目条件。推理链条极短,工具极基础,但打击精准而致命。

证明二(几何方法——对称空间的刚性)

第二条证明路径则充分利用了题目给出的所有几何条件:

它利用格的几何结构,构造了从万有覆盖到对称空间的等变映射。然后证明 (\gamma) 在两个空间上的 Lefschetz 数必须相等。在万有覆盖一侧,由于 (\gamma) 的作用是自由的,Lefschetz 数为零。但在对称空间一侧,根据 Cartan 不动点定理,(\gamma) 必然存在不动点,因此 Lefschetz 数非零。再次得到矛盾。

这条证明路径更长、更深,但它回答了一个更本质的问题——不仅告诉你"不可能",还解释了"为什么在这个具体的几何框架下不可能"。

数学界权威 Sang Hyun Kim 评价这道题的解答时说,这是他第一次看到 AI 完美无瑕地串联运用了多个深奥的数学定理,堪称"独一无二的稀有案例"。

5.2 P2:表示论中的"万能函数"

问题背景:P2 来自数论与表示论的交叉领域。在非阿基米德局部域上的矩阵群表示中,需要证明存在一个"万能的" Whittaker 函数 (W),使得局部 Rankin-Selberg 积分对所有配对表示都非零。

答案:存在。可以构造出这样一个"万能" (W)。

Aletheia 的解法

整个证明最关键的一步是 Whittaker 函数 (W) 的选取。Aletheia 选择了一个特殊的 (W),这一个选择同时实现了三个目标:

  • 将积分域压缩到一个紧集上,使得原本需要处理的无穷积分变成了在有限区域上的计算
  • 消去了复参数 (s),消除了解析延拓等复杂操作的需要
  • 将一个无穷维的解析问题转化为有限维的代数问题

最关键的是,这个 (W) 不依赖于配对表示 (\pi)——同一个选择对所有 (\pi) 都有效。这在表示论中是极其罕见的性质。

然后,Aletheia 用反证法完成证明:假设对所有 (V) 积分都为零,通过有限 Fourier 分析可以推出测试函数具有"平移不变性",这意味着表示 (\pi) 在一个比其导子(conductor)更粗的子群下有不变向量。但根据导子的定义,这恰恰是不可能的。矛盾恰好卡在导子的定义上,一步不多一步不少。

这道题的解答展示了 Aletheia 在抽象代数领域的推理深度——它不仅能进行符号计算,还能做出具有"数学品味"的策略性选择。


六、Aletheia 的工具链与自主性保障

6.1 工具使用

Aletheia 在解题过程中不是"闭卷考试",它可以使用以下工具:

  • Google Search:用于搜索数学文献、查找定理的精确陈述
  • 网页浏览:用于阅读 arXiv 上的论文、查阅在线数学资源
  • Python 计算:用于辅助数值验证和符号计算

工具使用的核心目的是防止引用幻觉(citation hallucination)。传统 AI 系统在处理复杂数学推理时,经常会"发明"不存在的定理或错误地引用文献。Aletheia 通过实时搜索和浏览来确保每一个引用都指向真实存在的、经过同行评审的数学结果。

6.2 自主性保障机制

DeepMind 在论文中详细披露了他们确保自主性的具体措施,莫潇羽@源码七号站认为这些细节对于理解结果的可信度至关重要:

生成阶段:Aletheia 直接接收 LaTeX 格式的原始题目描述作为输入,不附带任何人类提示或引导。整个生成过程中没有人类参与。

筛选阶段:Aletheia 的输出通过一个预设的"验证与提取提示"(Verification and Extraction Prompt)进行自动过滤。这个提示的作用是确保输出符合数学文献的严格性标准,并直接生成 LaTeX 代码,避免人工格式化的需要。这个提示也被完整公开在论文的附录中。

评审阶段:人类专家仅在事后对最终输出进行评审。在评审过程中,专家们没有与模型进行任何交互——他们没有要求模型解释某个步骤,也没有指出可能的错误让模型修正。

时间戳认证:为了防止数据污染(即模型在答案公布后"偷看"答案),DeepMind 在 FirstProof 公布官方答案之前,就通过私下时间戳的方式向挑战赛组织者提交了他们的解答。

完全透明:所有的原始提示和模型输出(无论对错)都已经在 GitHub 上完整公开:

https://github.com/google-deepmind/superhuman/tree/main/aletheia


七、推理时计算扩展:让 AI "想得更久"

7.1 什么是推理时计算扩展

推理时计算扩展(Inference-Time Scaling)是理解 Aletheia 和 Gemini Deep Think 性能飞跃的关键概念。

在传统的 AI 系统中,模型在训练阶段投入大量计算,但在使用阶段(推理阶段)对每个问题使用的计算量基本是固定的。无论你问的是"1+1等于几"还是一个需要数学博士花三天才能想明白的证明,模型使用的计算资源差不多。

推理时计算扩展改变了这一模式。它允许模型根据问题的难度,在推理阶段动态地分配更多的计算资源。具体来说,Gemini Deep Think 会:

  • 并行探索多条推理路径:不是线性地走一条思路走到底,而是同时展开多个可能的证明方向
  • 自适应调整思考深度:简单问题快速回答,复杂问题投入更多的"思考时间"
  • 通过回溯和重试来纠错:当某条推理路径走入死胡同时,能够回退并尝试其他方向

7.2 扩展规律的实证数据

DeepMind 的研究发现,推理时计算扩展存在一个清晰的幂律关系(scaling law):随着推理计算量的增加,模型的准确率呈现出可预测的提升。

关键发现包括:

  • 这个扩展规律不仅适用于竞赛级别的问题,也适用于博士级别的习题(FutureMath Basic 基准)
  • 但随着问题难度的增加,同样的计算量换来的准确率提升会递减——这就是为什么需要 Aletheia 的智能体架构来弥补
  • 2026年1月版本的 Deep Think 在达到同等准确率时,所需的计算量仅为2025年7月版本的 1/100

这意味着 AI 的数学推理能力正在经历双重提升:一方面模型本身在变得更聪明,另一方面达到同等智能水平所需的成本在快速下降。


八、更广阔的背景:AI 数学能力的加速进化

8.1 FrontierMath 基准的快速"过期"

要理解 Aletheia 的成就为什么如此重要,需要把它放在 AI 数学能力快速进化的大背景下。

2024年11月,非营利研究机构 Epoch AI 发布了 FrontierMath 基准测试(https://epoch.ai/frontiermath),包含350道由专业数学家设计的高难度数学问题,分为四个难度等级(Tier 1-3 约300道,Tier 4 约50道),难度从高年级本科到博士后水平不等。

当时的状况是:最强的 AI 模型连基础题库2%的题都做不出来。

但到了2026年初,形势已经发生了剧变。根据 Epoch AI 和 IEEE Spectrum 的最新报道,GPT-5.2 和 Claude Opus 4.6 等模型在 Tier 1-3 上的正确率已经超过40%,在最难的 Tier 4 上也突破了30%。

基准测试被快速"做穿"的速度远超所有人的预期。

8.2 FrontierMath: Open Problems——更高的天花板

正是意识到了这一点,Epoch AI 在2026年1月27日推出了一个全新的测试——FrontierMath: Open Problemshttps://epoch.ai/frontiermath/open-problems)。

这个题库与之前所有的数学基准测试有着根本性的不同:它收录的是连人类数学家都没有解决的真正未解之谜。

截至发布时,题库包含16道(后续还会增加)开放性数学问题,涵盖数论、组合学、代数几何、拓扑学等领域。每道题都是由专业数学家从自己的研究中提出的,已经有多位数学家认真尝试过但未能解决。

更巧妙的是,虽然这些问题没有已知答案,Epoch AI 为每道题编写了自动评分程序——一个可以通过相对简单的计算来验证候选解是否成立的程序。这解决了开放性问题评估的核心难题:你不需要知道答案是什么,只需要能验证一个候选答案是否满足所有要求的条件。

截至目前,没有任何 AI 系统解出其中哪怕一道题。这个"零分"的现状反而恰恰证明了题库的价值——它提供了一个真正的"天花板",在未来相当长的一段时间内不会被轻易突破。

8.3 FirstProof 第二轮:更难的题目即将到来

FirstProof 团队也没有打算止步于此。他们已经宣布将在2026年3月14日推出第二轮挑战赛,预计题目难度会进一步提升,评估流程也会更加规范化。

第一轮挑战赛被定义为一个"实验性试验",规则并不十分明确,这也导致了一些关于"什么算自主解答"的争议。第二轮预计会制定更严格的参赛规则和评审标准。


九、陶哲轩的判断:AI 已经是"初级合著者"

在这场技术风暴中,最值得倾听的声音之一来自陶哲轩(Terence Tao)——菲尔兹奖得主,被广泛认为是当今世界最杰出的数学家。

9.1 从预测到验证

早在2023年,陶哲轩就在为微软撰写的一篇文章中做出了一个大胆预测:到2026年,AI 将能够达到论文合著者的水平,成为数学研究中可信赖的合作伙伴。当时这个预测褒贬不一——有人觉得太乐观,有人觉得太保守。

现在看来,陶哲轩的预测与现实几乎完全吻合。在2026年2月的最新访谈中,他表示:

"我们基本上已经看到 AI 的贡献,与我期望一个初级人类合著者所做的贡献处于同一水平——尤其是一个非常乐意做'苦活'、愿意计算大量繁琐案例的合著者。"

9.2 从"个案研究"到"大样本普查"

陶哲轩描述了一种正在形成的全新数学研究范式。他用了一个精妙的比喻:传统数学研究就像"个案研究"——一篇论文紧盯一两个问题往死里磕,这是数学家几百年来的工作方式。但 AI 正在让数学家第一次有能力做"大样本普查"。

以 Paul Erdős 留下的1000多个数学问题为例。人类数学家通常只会挑选与自己专长相关的几道来研究。但 AI 可以系统性地扫描所有1000多道题,从中识别出可以突破的题目,逐个尝试。DeepMind 的 Aletheia 实际上已经在这样做了——它对 Erdős 问题数据库中的700道开放问题进行了半自主评估,自主解决了其中4道之前无人解出的问题。

陶哲轩还指出,数学研究中有大量极其繁琐的计算和案例分析,人类数学家通常非常抗拒做这些工作,会绞尽脑汁想办法绕过去。但 AI 不嫌烦。它乐意不知疲倦地把这些枯燥的推演全部跑完。当 AI 被整合进人类的工作流,这些曾经让人望而却步的障碍就直接被跨过去了。

9.3 "直升机式"的知识获取

但陶哲轩也表达了一个重要的担忧。他用了一个形象的比喻:传统的数学研究就像"徒步旅行"——你在前往目的地的路上会留下路标,绘制地图,这些路上的收获对整个数学社区都有价值。但 AI 的解题方式更像是"坐直升机直接空降到目的地"——你到达了目标,但错过了旅途本身带来的所有洞察。

换句话说,AI 可以快速给出正确答案,但它的证明过程往往缺乏人类数学家在探索中积累的那种直觉和深层理解。正确答案本身只是数学研究价值的一部分,通往答案的旅程同样重要。

不过,陶哲轩也坦诚承认自己从 AI 的解题过程中学到了东西。他举例说,AI 可能在某个证明中用到了一篇1960年论文里的某个小技巧,这个技巧是他自己从未注意到的。AI 能做到那些人类专家看了一眼就"懒得去试"的事情。


十、Erdős 问题数据库的系统扫描:AI "大样本普查"的实战案例

在深入更多技术细节之前,莫潇羽@源码七号站认为有必要单独介绍一下 Aletheia 在 Erdős 问题数据库上的实战表现,因为这个案例最能体现陶哲轩所说的"从个案研究到大样本普查"的范式转变。

10.1 什么是 Erdős 问题

Paul Erdős(保罗·埃尔德什)是20世纪最多产的数学家之一,一生发表了超过1500篇论文,合著者遍布全球。他有一个著名的习惯:在各种场合提出数学问题,并根据问题的难度悬赏不同金额的奖金。在他1996年去世后,这些问题被整理成了一个数据库,由数学家 Thomas Bloom 维护,目前收录了超过1000道开放性数学问题。

这些问题的难度参差不齐。有些可能只需要一个精巧的组合论证就能解决,有些则可能需要全新的数学理论才能攻克。关键在于,在 AI 出现之前,很少有人会系统性地逐一审视这上千道问题——每位数学家通常只会关注与自己研究方向相关的少数几道。

10.2 Aletheia

🔒
🔒 该内容仅对更高等级用户组开放,请升级您的账户等级以查看完整内容。
您当前:游客 · 可见 60% 内容 · 升级至 注册用户 可见 70%
👀
游客
可见 60%
✓ 当前
注册用户
注册用户
可见 70%
社区精英
社区精英
可见 100%
社区守护
社区守护
可见 100%
仅解锁本文,永久有效。如需PDF珍藏版,请联系站长获取。 当前单篇价格 ¥9.9
✏️ 发表评论

请先登录后发表评论

前往登录
📊 站点统计
今日发布1 篇
文章总数1249 篇
昨日发布1 篇
本月发布24 篇
建站时间384 天
🔍 搜索
📅 日历
« 2026 » « 08 »
     12
3456789
10111213141516
17181920212223
24252627282930
31      
站长微语

联系站长

微信:165255185
AIGC 技术社区
致力于解码 AI前沿技术 与经验分享
纯粹的技术交流社区

💡 欢迎您的建议与反馈,让社区变得更好

快速通道
联系站长
站长微信二维码
AI交流群
AI交流群二维码
友情推荐