Sam Altman最近在公开讨论中反复提到一个判断我听完挺有触动AI的数学能力差不多三年时间从“小学水平”一路冲到了“千禧年大奖难题”这个量级。说“小学水平”真不是夸张2021年我拿当时几个主流大模型做对比测试让它们算一道两位数乘法十个模型里能全对的不到一半。到2023年GPT-4出来微积分、线性代数这类大学数学基本能稳住但一到竞赛级别的几何题就开始胡说。再到2024年底、2025年初o系列模型在IMO国际数学奥林匹克真题上已经能摸到金牌选手的线。三年这条曲线的斜率确实吓人。这篇文章我想认真拆一下这三年到底发生了什么。AI数学能力是真的“理解”了数学还是另一种更高明的模式匹配推理时计算、RLVR、思维链这些词对不搞AI底层的人来说到底意味着什么千禧年大奖难题作为目标背后隐含了什么样的技术野心以及最实际的——既然AI数学这么强了我们这些做开发、做研究、甚至还在读书的人手上的工具和思路要怎么跟着变。1. 三年跨越的真实坐标AI数学能力到了哪一步1.1 从“两位数乘法都算错”到IMO金牌线先把时间线摊开看你会发现这个进步不是匀速的而是加速的。2021年前后GPT-3那一代模型的数学能力基本是“人工智障”级别。两位数加减法经常错三位数乘法基本靠蒙你问它鸡兔同笼它敢给你算出负数。当时圈子里有个经典段子让大模型算“17×23”它信心满满地给出一个错误答案还附赠一段煞有介事的解题步骤。那会儿大家普遍认为数学这种需要精确推理的领域大模型短期内很难突破。2022年底ChatGPT上线基于GPT-3.5数学能力有了肉眼可见的提升。简单算术题正确率上来了但遇到“把一根绳子剪成三段每段比前一段长1米”这种初中应用题还是会偶尔绕晕。本质上那个阶段的模型还是在“根据训练数据里的相似题目猜答案”而不是真正在推理。2023年3月GPT-4发布这是一个分水岭。SAT数学、AP微积分这类标准化考试GPT-4已经能考出高分线性代数、概率论里很多常规题目它也能给出像样的推导过程。我记得当时拿一个多元函数求极值的题去试它不光算出了驻点还主动分析了Hessian矩阵的正定性来判断是极大还是极小——这个步骤意识已经接近一个正经学过高数的学生了。真正的质变发生在2024年。OpenAI发布o1系列首次把“推理时计算”这个概念推到台前。o1在AIME美国数学邀请赛上表现惊人在2024年IMO预选赛里能排到前500名后续的o3更夸张2025年的AIME测试里几乎满分而且已经开始触碰一些偏研究性质的数学问题。DeepMind那边也没闲着AlphaProof在2024年IMO上用形式化语言Lean成功解出了两道难题其中一道的难度系数是IMO历届最高的。所以说Sam Altman说的“从小学数学到千禧年大奖难题”不是嘴嗨。三年AI在数学这条赛道上走完了人类从小学到博士候选人的路。1.2 “千禧年大奖难题”不是营销话术这里要先泼一盆冷水AI并没有真的解出千禧年大奖难题。七个问题P vs NP、黎曼猜想、纳维-斯托克斯方程、杨-米尔斯存在性与质量间隙、BSD猜想、霍奇猜想以及已证明的庞加莱猜想仍然是未解状态AI离攻克它们还很远。但“够得着”和“完全没戏”是两回事。现在的顶级推理模型已经能做到什么呢它能够理解这些问题的表述能够基于已有文献生成有意义的推理路径能够在局部引理上给出可验证的证明尝试。换句话说AI开始像一个博士生一样“上手做”这些问题了而不是只能像个搜索引擎一样复述别人做过的东西。这个转变的深层意义在于数学竞赛题是“有答案的问题”而千禧年难题是“没有已知答案的问题”。前者考验的是在有限知识库内找到正确路径后者考验的是在无边界的未知空间里开辟新路。从“会做已知题”到“面对未解问题”这中间隔着的不是知识量而是推理策略的泛化能力。o系列模型展现出的一个关键能力就是在没有标准答案的情况下自己生成多种解题路线再逐步验证哪条走得通——这正是数学研究最底层的劳动方式。1.3 为什么数学是衡量AI智能的标尺选数学当参考系不是因为它最容易恰恰因为它最“干净”。数学题有唯一正确答案对就是对、错就是错不搞模糊地带。这种可验证性让数学成了AI推理能力的显微镜——你随便换什么评价指标都会被质疑但数学题的分数不会说谎。而且数学的难度梯度非常连续。从四则运算到代数方程从微积分到实分析从竞赛几何到前沿猜想每一级都有清晰的难度标志物。AI走到哪一级我们就能精确地在人类知识坐标系里找到它的位置。相比“会写诗”“会聊法”“能编程”数学能力是最不带水分的测量仪。2. 数学能力跃迁背后四个关键引擎2.1 推理时计算让模型学会“打草稿”传统大模型的运作方式你问它一个问题它立刻根据训练数据里的概率分布往外蹦词一步到位没有中间过程。这相当于考试的时候眼睛一扫题目就张口报答案全靠经验没有演算。2024年o1系列带来的最大变化就是给了模型“打草稿”的时间。用行话叫推理时计算test-time compute模型在给出最终答案之前内部会先生成一大段思考链——尝试各种可能的路径发现走不通就退回来换一条最后把思考成果压缩成输出。这就像把一个学生从“口算选手”变成“草稿纸选手”准确率提升是必然的。代价也相当直白token消耗量暴涨。同样一道数学题传统模型可能输出200个tokeno1可能要烧掉几千甚至上万个token成本和延迟都上去了。但这笔交易划算因为数学推理本身就是“慢工出细活”宁可多花算力也要把过程走扎实。基于我实际使用的体验o1系列做难题时风格上很像一个谨慎的数学系学生先确认问题定义再分情况讨论算到中间发现矛盾会回头修正最后还做个交叉验证。这个“回头修正”的能力是前代模型最欠缺的。2.2 RLVR用“答案对不对”当训练信号光给模型推理时间还不够训练阶段也得升级。之前大模型训练主要靠RLHF基于人类反馈的强化学习就是让人类标注员给模型的回答打分“这个回答更好”或者“这个不行”。但人类打分又慢又贵而且数学题的对错其实不需要人来评判。于是出现了RLVRReinforcement Learning with Verifiable Rewards基于可验证奖励的强化学习。核心思路很简单数学题的答案可以自动验证对就是对错就是错这个信号干净利落不需要人工标注。具体怎么操作呢让模型做大量数学题做对了给正奖励做错了给负奖励然后反向传播去调整模型参数。这个循环跑起来以后模型在数学上的进步速度远超人类的预期因为数据量可以做得非常大——题目不够就让模型自己生成题目再自己解答解答对了就当作正样本继续训练。这就是所谓的“合成数据飞轮”。数学是RLVR最完美的应用场景因为答案是确定性的、可程序化验证的。这个技术思路往代码领域迁移也很顺——代码能不能编译运行、测试能不能跑通也是自动可验证的。所以你会看到2024年之后AI编程能力的进步和数学能力几乎同步底层是同一个引擎在驱动。2.3 思维链与过程奖励把推理过程摊开来看“思维链”Chain of ThoughtCoT这个词早在2022年初就被研究发现了在一个数学题的提示词里加上一句“请一步步思考”模型的正确率立刻大幅提升。原因很简单大模型本质上是个概率预测机器让它直接输出最终答案等于是让它从一个很高的抽象层次直接落笔中间容易出错而让它把中间步骤都写出来每一步的预测难度就降低了相当于把一个困难问题拆成了很多个简单问题。但光让模型“写过程”还不够训练时怎么评价这个过程也很关键。早期的做法叫结果奖励——只看最终答案对不对。但这里有个bug如果模型的推理过程是胡编的只是答案碰巧对了模型就会学到“过程不重要蒙对就行”。于是有了过程奖励模型Process Reward ModelPRM对推理的每一步单独打分哪一步逻辑跳跃、哪一步依据不足都能标记出来。这就像批改试卷时不光看结果还看步骤分。数学是过程奖励最理想的练兵场因为数学推理天然是链条式的每一步都有明确的逻辑依据。一旦模型在这套训练下学会了“每一步都走坚实”这个能力会迁移到其他领域——写代码时逐步排查bug写论文时逐条验证逻辑本质上都在用同一套推理肌肉。2.4 搜索与自我验证从AlphaGo借来的思路如果只靠“生成一次答案”模型总归有运气成分。于是研究界把AlphaGo那套搜索策略搬了过来让模型同时生成多条推理路径像一棵树一样分叉探索然后对每条路径进行评估保留最有希望的分支继续深挖。这就是所谓“搜索自我验证”。具体到数学场景模型面对一道题先发散地生成若干个可能的解题方向每个方向往下推几步看是否遇到矛盾遇到矛盾就砍掉这个分支换下一个最后收敛到一条或者几条最可靠的路径上。整个过程就是AlphaGo下围棋时“算后续变化”的翻版。DeepMind的AlphaProof就是这套思路的极端体现。它把数学题翻译成Lean一种形式化证明语言然后在形式化空间里暴力搜索合法的证明步骤。2024年IMO它解出的那道最难题本质上就是搜索空间足够大、剪枝策略足够好最终找到了那条正确的证明链。这条路子虽然费算力但代表着AI数学能力的又一个上限不依赖“见过类似题”而是纯靠逻辑搜索从零构造证明。3. 千禧年难题的意义不止是数学界的狂欢3.1 七个问题里AI最可能在哪个方向突破千禧年大奖难题是2000年由克莱数学研究所提出的七个数学难题每个悬赏一百万美元。七个问题里庞加莱猜想已经被俄罗斯数学家佩雷尔曼证明剩下六个仍然悬而未决。这六个难题难在不同的地方黎曼猜想关于素数分布的规律纳维-斯托克斯方程关于流体力学的光滑性P vs NP关于计算的本质极限。其中和AI关系最深的是P vs NP。简单说它问的是“如果一个问题的答案能被快速验证那这个问题是否也能被快速求解”比如填数独验证一个答案是否正确很容易几秒钟但找到这个答案可能非常难可能要穷举很久。P vs NP问的就是“验证容易”和“求解容易”到底是不是一回事。这直接决定了AI、密码学、优化算法这些领域的根本边界。AI最实际的参与方式大概率不是一上来就“证明”整个猜想而是从外围切入用机器学习在海量数据里发现新的数学规律生成可验证的猜想辅助人工完成局部证明。已经有数学家这么干了——通过分析黎曼zeta函数零点的海量计算数据发现了之前不知道的规律模式。AI在这种场景下是“科研加速器”不是“解题者”。3.2 数学家与AI协作的现状从工具到合作者以前数学家的工作流是“纸笔推演 直觉猜想 同行评审”现在这个流程正在被AI和设备工具深入改写。形式化证明是当前最靠谱的一条路。Lean这个证明助手让数学家可以把证明转换成机器可验证的格式每一道推导步骤都必须经过软件核对。AI在这种格式里能做两件事一是自动补全证明中的琐碎步骤让数学家专注核心思想二是通过搜索帮人类找证明的突破口。AlphaProof在2024年IMO上的成功验证了“AI形式化证明”这条路线的可行性。但大部分数学家对AI的态度还是复杂的。一方面AI生成“看起来很有道理但实际是错的”证明太常见了浪费了大量审查时间另一方面AI确实能处理数据密集型的探索工作。我接触的数学方向的博士生越来越多地把AI当成“灵感生成器”——从AI那里拿到一个粗糙的猜想方向再用自己的专业能力去验证或证伪。这个分工有点像天文学家先让望远镜大范围扫描星空再人工聚焦有异常信号的星体。3.3 数学能力是AGI的“通用推理”温度计为什么Sam Altman这种做AGI的人这么关心数学能力因为数学推理不是一门独立的技能它是“通用推理”最纯粹的形式。你让AI做数学题本质上是在测试它的逻辑链构建能力、假设检验能力、抽象建模能力——这些能力迁移到编程、科学发现、法律推理、医疗诊断等场景是同一个底层系统在工作。数学题有一个无可替代的优势它的反馈信号极干净。现实世界的问题到处是噪音——用户需求模糊、业务逻辑复杂、评价标准多元。而数学题对就是对错就是错这使得它能以最快的速度训练模型建立起扎实的推理基础。你可以把数学理解成模型的“基础体能训练”体能上来了再去打篮球、游泳、跑步都会快很多。所以当AI的数学能力一路冲到千禧年难题的边缘背后的信号是它的通用推理能力可能已经在很多非数学领域跨越了某个关键阈值。数学只是我们最容易观察到的那个窗口。4. 对我们这些搞AI、用AI的人这意味着什么4.1 AI编程能力同步进阶开发工作流正在被重构数学推理能力的机械版就是代码推理。代码和数学共享同一套逻辑本质变量、类型、函数、循环、条件分支本质上都是逻辑关系的表达。所以当模型在数学上实现跨越编程能力几乎是同步进步的。我自己最近的一个实操案例做一个推荐系统小组件梯度推导一直是烦心事。以前我要么自己手推要么去翻教材费时费力。现在我把问题丢给AI“给定这个损失函数请推导出对用户嵌入矩阵的梯度并解释每一步用到的链式法则”AI给的推导干净利落还顺带提醒我忘了加正则项。然后我直接把它推导的公式实现成代码测试跑通一次过。这类场景正在变成日常。AI早就不是“代码补全器”了它的角色是“逻辑伙伴”——帮你把模糊的问题定义清楚把复杂的逻辑拆解换掉在你不确定的地方从第一性原理重新推导。这对独立开发者和小团队是巨大的杠杆相当于团队里多了一个24小时待命、数学基础扎实到毕业水平的工程师。4.2 提示词设计也要更新版本AI数学能力变强了但这不意味着你可以随便问。我自己调过很多次prompt经验是跟AI沟通数学和逻辑问题提示词也要跟着升级否则AI再聪明也发挥不出来。旧时代的提示词思路是“给AI套上紧箍咒”明确角色、规定步骤、限定输出格式。这类指令在今天依然有用但处理复杂的推理问题时更好的策略是给AI留出思考空间。我推荐一个简单好用的模板先让AI用自己的话复述问题再让它独立尝试至少两种解法并进行交叉验证最后基于验证结果给出最终答案。就这么简单正确率能提升一截。还有一个实操小技巧在提示词里明确要求“在面对不确定的地方先说明假设再继续推导”。数学推导最怕的就是模型默默做一个它自己都没意识到的假设然后顺着这个假设推出一个很精致的错误结论。让它把假设显式化你才有机会在早期发现方向不对。4.3 本地小模型也能分到数学能力升级的红利大模型参数动辄千亿普通人的消费级硬件跑不动但数学能力的提升也在往小模型溢。一个重要的技术是蒸馏——把大模型的推理能力压缩进小模型里让小模型在数学题上的表现不断逼近大模型。2025年的当下一些70B参数量级的开源模型数学能力已经超过2023年的顶级闭源模型本地部署的可行性非常高。本地部署推理模型我的建议是从量化版开始。以70B模型为例FP16原始权重需要约140GB显存普通机器根本装不下。用4-bit量化可以压到40GB左右一块消费级的RTX 409024GB不够但两块或者一张A600048GB就跑得动。再往下的7B/8B模型量化后不到6GBCPU推理都能跑适合放到个人笔记本上做日常数学辅助。要用好本地模型几个关键配置留意一下上下文长度建议拉到8K以上数学题推导过程长上下文太短会被截断推理线程数设成物理核心数不是越多越好开启KV cache量化能明显省显存。很多推理框架llama.cpp、Ollama等都有现成参数可以调改几个数字的事。5. 别被“跨越”迷惑当前AI数学的硬伤5.1 算力成本一道题可能烧掉一台设备好几个小时的电数学能力提升的代价是实打实的算力。o3在一道有挑战性的数学题上可能要消耗几十万甚至上百万token的推理量。这种量级的成本个人用户偶尔用用还行真拿去大规模做研究账单会非常感人。更极端的对比千禧年难题这种级别的问题如果真让AI去硬解以当前的推理时计算成本估计能把一家公司的算力预算烧穿。这就是为什么OpenAI在做模型蒸馏和推理加速——单纯堆算力不是可持续的路线必须在模型架构、推理策略上做优化把每次思考的“单价”打下来。能力进步和成本下降两条腿必须一起走。5.2 “做题家”与“数学家”的差距创造性还差得远现阶段AI在数学上的成功很大程度上是“做题家”式的成功——面对有明确答案的题目它能通过大量搜索和验证找到路径。但数学研究的核心其实在于“提出好问题”和“创造新概念”这些能力AI还远远没有摸到边。庞加莱说的“数学家的艺术不在于知道什么而在于发现什么”依然是对当前AI最恰如其分的评价。AI可以帮你把一条已经存在的证明路径走通可以帮你验证一堆已知猜想的数值证据但它很难像黎曼那样仅凭直觉就提出一个深刻到能重塑整个数论方向的猜想。创造力的本质是极度抽象的模式识别加审美选择而审美这种东西模型目前还没有。5.3 幻觉在长推导中依旧危险OpenAI自己的系统卡里都承认o1系列在推理过程中仍然会有幻觉。数学推导有个特点链条越长错误累积的風險越大。前20步全对第21步开始飘最后得出一个看似完美实则荒谬的结论——这种错误在长推导里非常难查因为它每一步看起来都挺有道理但逻辑的某个细缝里藏着一个致命的前提错位。这带来的实际风险是如果用户把一个重要数学问题完全交给AI并且缺乏验证意识AI给的结果“看起来越精致”就越危险。我自己处理长推导时有一道保险让AI用两种完全不同的方法去解同一个问题如果结果一致才认为高度可信如果有分歧基本说明某个推导路径上埋着雷。这种交叉验证的习惯可能是现阶段最实用的防呆策略。6. 常见疑问与实操建议6.1 “AI数学这么强我还学数学干嘛”这个问题我被问过好多次。我的回答一直很直接恰恰因为AI数学强了你才更需要学数学。原因特别简单AI会犯错而判断AI错不错的唯一方式是你自己得懂。你可以不会算积分但你必须知道积分是什么、结果长什么样算是合理。AI给你一个答案你要能评估它的可信度这个能力只能靠你自己的数学功底来提供。把数学理解成“AI输出的质检工具”这个定位比“AI的替代品”准确得多。而且数学思维本身就是一种元能力。学数学训练的是“把一个复杂问题拆解成清晰子问题”的抽象能力这种能力在任何需要AI协作的领域都直接可迁移。AI时代数学的定位从“计算工具”变成了“思维体操”——前者被AI接管了后者依然稀缺。6.2 三招验证AI的数学推导我实操下来最有效、最省钱的验证手段有三个。第一是交叉建模。同一个问题让AI用两种不同思路解比如一道概率题分别用条件概率公式和蒙特卡洛模拟去算看数值是否接近。如果两种思路结果一致出错的概率就非常低。第二是数值代验。符号推导的结果选取几个边界值代进去验证看是否满足原条件。写一段简单的Python脚本用sympy做符号计算和数值验证几分钟就能跑完能挡掉大部分低级错误。import sympy as sp x, a, b sp.symbols(x a b) # 假设AI给出了一个积分结果 f x**2 a*x b F_ai x**3/3 a*x**2/2 b*x # 这是AI给的积分 # 验证方法对F_ai求导看是否能还原出f assert sp.simplify(sp.diff(F_ai, x) - f) 0 print(积分结果验证通过)第三步是边界检查。把极端情况代入结果看是否合理。比如一个概率值检查是否落在[0,1]区间一个距离公式检查两点重合时是否为0。这步不需要工具纯靠直觉就能发现很多问题。6.3 给三类人的行动建议学生朋友把AI当陪练别当答案。数学实力的核心是“自己能把推理链条走通”AI可以帮你校对过程、提供思路但如果你直接抄答案你就永远失去了那个“卡住又打通”的成长过程。最好的用法是自己动笔做卡住的时候让AI给一个提示——不是直接给答案而是问它“这个题下一步应该从哪个方向切入”。开发者朋友重点去试“AI数学辅助开发”的场景。具体来说涉及算法推导、梯度计算、复杂度分析、正态分布等数学密集型任务时多让AI走几步给你看别只要结果。你会明显感觉到AI解释中间逻辑的能力比一年前强得多这个能力在调试代码、设计架构时同样好用。研究工作者一定要留意“AI形式化证明”这个方向。Lean等证明助手生态正在快速成熟哪怕你不是数学专业在论文里使用机器可验证的证明流程也会逐渐成为提升可信度的重要方式。现在开始上手属于早期红利期。写在最后的个人体会我用AI做数学辅助这两年最深切的感受不是“AI替代了我思考”而是“AI倒逼我思考得更严谨”。你让AI推导之前自己必须先能把问题定义清楚AI给出答案后你得有能力检验它AI推出一条路径时你还得能判断这个路径是否绕了远路。数学能力跨越这件事与其说是AI逼近人类不如说是所有人都get到了一个可以随时对话的、数学功底扎实到研究助理级别的助手。每次跟这个助手聊完一道题老实说我对“聪明”这个词的理解都在被刷新。人类数学家脑子里那种说不清道不明的直觉和美感AI暂时还没学会但它那种不厌其烦地推演、试探、回头修正的韧劲倒是很多人类做题时都学不来的品质。最后分享一个小技巧是我这段时间用得最多也最灵的让AI解数学题的时候别急着要答案先让它“用自己的话复述一遍问题”。就这么一句话能挡掉一大半因为理解偏差导致的错误推导。模型理解偏了你后面再怎么让它优化解法都是白搭而复述这一步等于强制它先把问题定义对齐后面所有的推导才有地基。这个习惯建议你现在就开始用。
