DeepMind发布Aletheia:AI自主解开4个数学难题
3月12日至13日,Google DeepMind发布了全新的AI科研智能体Aletheia。这不是又一个”做数学竞赛题”的AI,而是一个能独立开展职业级数学研究的系统——它自主解决了Erdős猜想数据库中的4个开放问题,并在高难度证明基准上达到了95.1%的准确率。AI,第一次真正摸到了”做科研”的门槛。
事件详情:从解题到”做研究”的质变
Aletheia的核心能力包括:
- 顶级证明能力:由增强版Gemini 3 Deep Think驱动,在IMO-Proof Bench Advanced基准上取得95.1%的准确率,该基准考察的是形式化数学证明能力,远难于普通问答;
- 攻克开放问题:自主解决了Erdős猜想数据库中的4个长期未解的数学问题——这些不是为AI准备的测试题,而是数学家们悬置多年的真问题;
- 独立撰写论文:无需人工干预,系统能自主检索科学文献、构建长程严谨证明、系统性地自我修正,最终生成独立的研究论文;
- 以”真理”命名:Aletheia源自希腊语,意为”真理的去蔽”——DeepMind显然希望它成为揭示未知真理的工具,而非应试机器。
DeepMind强调,Aletheia代表的是一种质变:从解决”自包含的竞赛问题”,转向”开放式的科研发现”。前者有标准答案,后者连问题本身都需要在探索中逐步澄清。
背景分析:AI数学能力的三次跃迁
回看AI在数学上的进击,大致经历了三次跃迁。第一次是”会算”:符号计算、定理证明器等工具,能处理规则明确的形式化任务。第二次是”会解”:以2024-2025年多家实验室冲击IMO金牌为标志,大模型证明了自己能在限时、限题的竞赛规则下战胜人类顶尖中学生。
Aletheia试图开启的是第三次跃迁——”会研究”。科研与竞赛的本质区别在于:竞赛题保证有解、保证优美;科研问题可能无解、可能需要发明全新的概念工具。一个能自主选题、查文献、构造证明、写论文的系统,意味着AI开始具备”学术生产力”,而不仅仅是”解题生产力”。
这也解释了为什么DeepMind选择数学作为突破口:数学证明是可验证的(对就是对、错就是错),为AI的自我修正提供了可靠的反馈信号。一旦这套”自主科研”的方法论跑通,复制到物理、化学、生物等同样依赖形式化推理的学科,只是时间问题。
影响展望:科研范式的重构才刚刚开始
最直接的影响在数学界:Erdős猜想库中还有数百个开放问题,Aletheia这样的系统可能以远超人类的速度”收割”其中相对孤立的难题。数学家的角色将从”证明者”转向”提问者”与”验证者”——提出好问题、判断AI证明的价值,将成为更稀缺的能力。
更深远的影响在于科研组织方式。如果AI能承担文献综述、证明构造等耗时工作,一个”一人实验室”的产出可能超过传统团队,科研的规模效应将被彻底改写。同时,如何认定AI独立完成的成果的学术归属、如何防范”论文灌水”,学术共同体需要新的规则。
当然,质疑声同样存在:Aletheia解决的4个问题在数学版图上的”分量”究竟如何,仍需同行评议检验。但无论如何,一个能自主做研究的AI系统的出现,都标志着大模型的能力边界又向前推进了一大步——从”回答已知”,走向”探索未知”。
当然,冷静的声音同样值得倾听。数学界对“AI证明”的接纳向来谨慎:一个证明不仅要正确,还要“美”、要有洞察力,能启发新的数学。Aletheia目前的强项是攻克相对孤立的难题,而提出深刻的新概念、新纲领——数学皇冠上真正的明珠——仍是人类的领地。但这并不妨碍它成为数学家最强大的“外脑”:人类负责仰望星空,AI负责脚踏实地地验证每一条路。