从考试基准到未知数学:Greg Burnham 如何判断 AI 进步是否真的变快
这期 The TWIML AI Podcast 由 Sam Charrington 访谈 Epoch AI 的 Greg Burnham。Burnham 讨论 AI 能力评测为何正在从考试题转向真实工作、数学研究、未知答案基准和在线学习:模型在数学上的进展很快,但解决难题并不等于已经稳定具备新理论创造、研究品味或部署中的自我学习能力。
一、嘉宾背景
这期节目来自 The TWIML AI Podcast,由 Sam Charrington 主持,题为《From Math Olympiads to Navier-Stokes: How Fast Is AI Progressing?》,上传日期为 2026 年 9 月 29 日,时长 4039 秒。节目讨论的不是单一模型发布或某一道数学题,而是一个更基础的问题:当 AI 从有标准答案的考试题进入工作、科研和未知答案问题时,应该怎样判断它到底进步了多少。
受访者 Greg Burnham 在 Epoch AI 负责 capabilities research。根据节目给出的背景,Epoch AI 研究 AI 能力,并开发跟踪 AI 优势与局限的方法;Burnham 和团队构建 benchmark 与评测方法,包括 Epoch Capabilities Index,用来跨任务、跨时间衡量 AI 进步。
这个身份决定了访谈的角度。Burnham 不是把数学结果当作孤立新闻来谈,而是把数学、开放式研究任务、在线学习、AI R&D tripwire、真实工作任务放进同一个评测框架。他的核心判断是:AI 的强项和短板已经开始影响现实世界,因此能力测量不再只是学术考试式排名,而是理解经济、科研、安全和实际部署影响的基础设施。
二、本期主要内容
节目从能力评测的阶段变化谈起。Burnham 把这个变化概括为从 “school to work”:到 2024 年底、2025 年初,许多考试式任务已经被模型处理得很好;进入 2025 年,更重要的问题变成 AI 是否能影响人类本来就在做的工作活动。Sam 随即追问一个常见疑问:如果很多 benchmark 已经接近满分,进步是否自然会变慢?Burnham 的回答是分两层看:已有 benchmark 上是否继续进步,以及 benchmark 没测到的能力是否可能没有同步进步。后一个问题更难。
Epoch 的方法是把不同时期、不同难度的基准连接起来。Burnham 说,他们仍然看到 benchmark 上的持续进步,因为过去难倒早期模型的测试会被后来的模型解决,于是需要用新的、更难的测试接上旧测试。Epoch Capabilities Index 就是为此设计的统一指标;Burnham 描述它在跨代模型上呈现平滑、近似线性的上升。不过他也明确说明,单个 benchmark 通常不是线性的,而是 S 曲线:从低分开始,快速提高,然后在接近 100% 时变平。
节目随后进入数学这条主线。Burnham 回顾,2024 年秋以前,基于 LLM 的系统在小学或中学数学文字题上仍会遇到挑战;GPT-4 在 GSM8K 上表现不错,之后评测焦点转向更难的 MATH benchmark。OpenAI 的 o1 preview 和完整 o1 发布后,数学竞赛能力大幅提高。Epoch 原始 Frontier Math 则把难度推到高年级本科、高年级研究生乃至早期研究热身题,需要深厚的细分领域背景。
Burnham 说,2025 年高中数学竞赛被攻克;到 2026 年初,AI 达到 International Math Olympiad 金牌水平,并解决了多数原始 Frontier Math 问题。真正的阶段变化是,数学评测开始转向未解问题:不是给 AI 一份研究生资格考试,而是问它能否解决专业数学家曾花时间思考却未解决的小问题。节目提到 Erdos 问题、unit distance problem 和 Navier-Stokes。Burnham 称,一个可能类似 Astra 的内部模型在 2026 年 5 月解决了 unit distance problem;他也把 Navier-Stokes 结果称为近期的 wow moment,并把它放在 Millennium Prize Problems 的背景下理解。
后半部分,Burnham 把“AI 是否有新想法”转化为可评测问题。Epoch 倾向于选择人类长期尝试但未解决、且结果可验证的问题,让 AI 解决后再请专家判断方案中包含哪些人类遗漏的思路。最新版 Frontier Math 也转向人类失败过、数学家感兴趣、可自动验证的问题,并按重要性从中等有趣到重大突破分层;Burnham 表示,当时最高级突破类问题尚未被解决。
节目最后转向真实工作和在线学习。Epoch 正在收集内部任务,包括研究报告、数据分析、信息图、短形式数据洞察和开放式研究原型,因为这些任务不容易用传统对错判分。Burnham 说,AI 做文献总结较强,但在制作符合 Epoch 风格指南的视觉图表、形成短数据洞察、提出新项目并做原型方面表现较弱。在线学习的例子是 Earthborne Rangers:同一个 AI 实例反复游玩、记笔记,通常不会随 playthrough 明显变强;更强的新一代模型主要只是初始分更高。
三、核心观点:推理、例子与边界
Burnham 的第一个核心判断是:观察 AI 进步,不能只盯着单一 benchmark。单个测试接近满分后自然会变平,这并不自动意味着整体能力放缓。旧测试被解决后,评测者需要引入更难的新测试,并用统计方法把不同时期、不同难度的测试连接起来。Epoch Capabilities Index 的作用就在这里:它试图从多个 S 曲线中抽取跨代趋势。但这个判断也有边界。Burnham 说,平滑、近似线性的上升是统计指数里的表现,不等于每个具体任务都线性进步;benchmark 没有测到的能力,也可能呈现不同走势。
第二个判断是,跨 benchmark 的同步进步本身需要解释。Burnham 给出两类机制:一类较浅,来自实验室和公司围绕用户需求、产品能力与 benchmark 收集训练数据;另一类更深,来自模型形成更强的泛化能力,把数学、软件或语言中学到的东西迁移到其他领域。他没有声称已经知道两者各占多少。这个保留很关键:如果进步主要来自针对性训练,能力边界会更依赖数据和任务覆盖;如果深层泛化更强,模型在未直接训练领域的表现就更难预测。
第三个判断是,当前趋势很强,但不必解释为模型侧不断发生断裂式跃迁。Burnham 的宏观解释是,AI 进步很大程度受 GPU、训练计算量、训练数据和算法创新等输入驱动;如果数据和算力供应链没有显著不连续跃升,模型侧凭空出现不连续跃迁的可能性较低。不过,他同时把递归自我改进或 software-only intelligence explosion 视为必须监测的例外:一旦 AI 能显著改进 AI 研发中的算法创新,反馈环就可能不再主要受物理世界中 GPU 和数据扩张速度约束。Epoch 的 tripwire 评测正是为捕捉这种变化而设计:让一个知识截止早于某项人类 AI 研发突破的离线系统,尝试提升相关指标,看它能否自行复现突破。Burnham 说,目前还没有看到系统做到这一点,也认为 AI 在 AI R&D 场景中的 research taste 仍然不足。
数学案例支撑了“进展很快但边界参差”的判断。AI 从 grade-school word problems、GSM8K、MATH、Frontier Math,一路推进到 IMO 金牌水平和部分未解问题,速度确实很快。但 Burnham 反复提醒,数学仍是 jagged frontier:AI 可以在一些轴上超越人类,同时在另一些轴上低于人类。数学家回看某些 AI 解出的难题时,常觉得方向并非极端意外,而更像是人类可能忽视了某条路线,或投入不够。AI 的优势似乎包括掌握大量既有文献、持续推进复杂逻辑和方程、并行探索许多方向。
Navier-Stokes 例子体现了这种分寸。Burnham 说,OpenAI 报告的系统包含由数千个 AI 实例组成的 swarm,它们尝试不同方向并共享想法,因此带有高层次 brute force 成分;但这既不是最低级的穷举,也不是完全从零建立理论。他还指出,这类解法仍建立在人类已有数学结构之上,而 AI 尚未充分展示数学家所说的 theory building。Burnham 用导数和积分作参照:真正的新概念可以打开大量问题;目前他还没有看到 AI 稳定创造这类基础概念。
评估“新想法”本身也必须保留不确定性。Burnham 的方法是先寻找人类长期失败但结果可验证的问题,再请专家事后审查 AI 解法。这比直接定义创造性更可操作,但并不是完全客观的测量。专家可能有自尊负担,也可能受到 hindsight bias 影响,在看到答案后觉得路线比事前更明显。unit distance 案例说明了这种复杂性:在 Timothy Gowers 的分析中,AI 不是证明猜想为真,而是给出反例;仅仅提示“去找反例”就已经很重要,因为人类此前主要在尝试证明它为真。Burnham 把 AlphaGo move 37 作为参照,因为围棋专家能够识别它的新颖性和关键作用;数学中是否会出现类似清晰时刻,仍是开放问题。
在线学习是另一条限制线。Earthborne Rangers 测试显示,新一代模型初始能力更强,但同一个实例反复游玩、记笔记后,通常没有明显学习曲线。Burnham 区分 model capability 与 harness capability,并说 Epoch 试过简单 harness、Claude Code、Codex、多 agent、记笔记工具和学习导向提示,仍没有破解高层策略学习。skills 或笔记能处理低垂果实,例如告诉系统某个菜单里有按钮;但面对必须自行发现策略的任务,详细攻略能提高表现,问题是 AI 还不能为自己生成这种攻略。
四、学习与应用
对研究者和产品团队来说,这期节目的直接启发是:评估 AI 不能只问“某个模型在某个榜单上多少分”。更稳妥的做法是同时看当前能力、趋势斜率、测试是否饱和、是否存在未覆盖能力,以及能力是否即将跨过应用阈值。旧 benchmark 接近满分时,应引入更难、更接近工作或研究的任务,并区分“模型真的学会了”与“harness、提示、工具或训练数据覆盖了”。
对企业使用者来说,Burnham 的框架提醒人们把考试成绩和工作能力分开。文献总结、资料整理、结构化报告这类任务可能已经很有用;但短数据洞察、符合品牌规范的图表、提出新研究项目、开放式原型等任务,仍需要更细的人工评审和真实工作样本。不能因为模型能通过考试,就假设它能稳定完成团队中 messy、模糊、需要品味的工作。
对科学和数学评测来说,未知答案基准是一条重要路径。它适用于人类长期尝试、结果可验证、且能够设计自动验证机制的问题。数值优化或实验指标更容易给连续分数,因为目标可以是超过人类最好水平;数学猜想则更常接近 all-or-nothing,需要靠足够多问题形成总体信号。边界在于:部分进展可能有价值却难以系统追踪,专家事后判断也可能有偏差,所以这类评测最好与人工审查、反事实提示分析和多样问题集结合使用。
对安全和治理来说,最值得持续监测的不是单次发布是否听起来“革命性”,而是平滑能力增长何时跨过现实阈值。Burnham 提到,ChatGPT 式有用性、Claude Code 式软件项目能力、网络攻击能力、家具组装照片纠错这类物理辅助能力,都可能来自持续增长跨过某个应用门槛。阈值难以预测,因此既要跟踪第一阶能力水平,也要关注斜率是否变化。
在线学习尤其值得单独评估。如果系统只能靠新一代预训练模型提高起点,那么风险和影响更多受发布周期控制;如果系统能在部署现场通过上下文、记忆、笔记和经验快速改进自己,能力增长就可能比实验室静态评测显示的更快。Burnham 的 Earthborne Rangers 结果说明,至少在这个测试中,当前系统尚未稳定做到高层策略自学;但他也强调,一旦这类能力出现,真实工作替代、网络安全和部署风险都会上升。
因此,应用这些观点时应保留边界:不要把节目标题中的数学突破当作 AI 已普遍具备理论创造力的证明;不要把某个 benchmark 的线性指数解读为所有任务都线性进步;不要把工具、笔记、多 agent 或详细攻略带来的表现提升直接归因于模型本身。更好的实践是把 AI 看作一个能力正在快速变化但边界参差的系统:在高价值场景中测实际任务,在开放任务中保留人工判断,在安全场景中监测阈值,在科研场景中区分复杂推导、文献整合、并行搜索和真正的新概念创造。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment