AI首次拿下IMO官方满分金牌,背后藏着一套自我纠错机制

栏目:互联网 | 来源:机器之心Pro | 2026-08-03 18:06

编辑|杜伟

在上个月落下帷幕的第 67 届国际数学奥林匹克(IMO 2026)上,包括中国代表队三位选手(邓乐言、刘澈、张柏伦)在内,全球共有 7 名人类选手拿到了 42 分满分金牌。

同时,本届 IMO 上大放异彩的不只有这些人类选手,大模型也交出了一份满分答卷。

它正是来自小红书的「dots-note-3.0」,并由此创下了一个历史记录 ——中国选手与中国模型,首次在 IMO 顶峰相见

小红书 IMO 满分夺金获人民日报报道。原链接:https://www.peopleapp.com/column/30052732612-500007612298

去年谷歌的 Gemini Deep Think 在 IMO 2025 中解出了 6 道题中的 5 道,以 35 分达到金牌标准。今年小红书 dots-note-3.0 提交的六道题均获得 7 分,成为首个经 IMO 官方评阅取得满分的 AI 模型。仅仅过去一年,大模型在高难度数学证明任务上又进了一步。

图源:小红书大模型后训练负责人乔超(Chao Qiao)X Post

外界的讨论很快从 42 分本身,转向这 42 分是如何拿到的。SGLang 核心成员 Chayenne Zhao、SGLang Omni 核心开发者 Yichi Zhang 以及 HuggingFace AI 研究及社区生态相关负责人 Adina Yakup 等对小红书大模型完成证明的方式给予了很高的评价。

截图自 X Post

dots-note-3.0 在解题过程中反复检查漏洞、调整思路,最终交出六份完整证明。自我检查与持续修正贯穿其中,也让这份成绩有了超出数学竞赛本身的意义。

42 分的含金量,藏在六份完整证明里

相较于普通数学题,证明题要麻烦得多。一道计算题只要结果正确,通常就能完成判定。证明题检查的是整条论证,结论碰巧正确,中间的推理依然可能存在漏洞。

一段数学证明读起来十分通顺,里面可能还藏着未经证明的假设;某个推导在大部分情况下成立,但是碰到边界条件却会失效;模型甚至可能引用一个听上去熟悉、实际上并不存在的定理。这些问题很难通过比对答案发现,只能沿着证明过程逐一核查。

这正是 IMO 的特殊之处。它要求选手提交完整的自然语言证明。模型需要将每一个关键步骤写清楚,条件有没有遗漏,结论能否由前文推出,推导中是否存在逻辑跳跃,都要接受专业评阅。

dots-note-3.0 满分 42 分的价值,落在了这六份经得起逐步检查的证明上。相较于其他依靠模板匹配、答案比对或自动测试完成判定的评测,IMO 的专业阅卷更容易暴露长链条推理中的隐藏问题。模型即使抓住了大致方向,只要关键步骤缺少论证,仍可能丢分。

具体到证明本身,第三题(Problem 3)提供了一个比较有代表性的案例。

根据 CMO 金牌得主汪千桐的说法,对于这道组合数学中的两人博弈与极值证明题,人类选手常见的做法是转换成图论中的连通性问题,而 dots-note-3.0 另辟蹊径,选择使用「归纳法」处理:先设计一组按倍数递减的木段,再通过归纳化证明,无论项羽如何落刀,刘邦最后失去的总长度始终受到同一个上限约束。原本变化繁多的博弈过程,被压缩成一条简洁、完整的证明链。



完整证明:https://studio-dots-ai.github.io/dots_imo_2026/proofs/Problem3.pdf

dots-note-3.0 交出的不仅是正确答案,在部分题目中它能够绕开常见思路,找到更简洁的证明路径。这也说明,该模型具备了一定的自主探索能力。

不过在 IMO 这块足够严格的试验场,思路巧妙并不等于稳稳拿到 7 分。评委最终检查的是整份证明,漏掉一个边界条件或者跳过一步关键推导,都可能导致失分。

模型还要完成另一项工作:在提交答案前重新审查自己的证明。dots-note-3.0 最值得关注的能力,也由此浮现了出来。

让模型学会给自己的证明挑错

dots-note-3.0 的证明、检查与修改,没有依赖 Lean 等形式化证明系统,不需要提前将题目翻译成机器可验证的形式化语言。

直接读取了原始 LaTeX 题目,以自然语言展开推理,并结合 Python 辅助分析,以 Agentic 方式端到端完成解题。这种路径更接近人类用自然语言构思和书写证明的过程。

在实际数学研究中,人类通常用自然语言搭配数学符号提出思路、展开推导。这种表达更加灵活,也更贴近真实的解题过程,但缺少形式化系统的逐步校验,这对模型提出了更高要求:需要主动回头检查自身论证并予以改正。dots-note-3.0 具备了这样的能力,它的解题流程包含了Proof、Verify 和 Refine三个环节,其中:

  • Proof 负责生成候选证明。模型尝试不同思路,形成多份可能成立的解题方案。
  • Verify 负责检查已有证明,判断论证是否正确、完整,寻找条件遗漏、逻辑跳跃和推导不严谨的地方,并给出改进建议。
  • Refine 根据检查结果修改答案,重新处理存在问题的部分,再将多轮推理得到的方案整合起来,形成可以提交的完整证明。

以上三个相互衔接的环节,分别负责生成初稿、检查漏洞和修改答案。完成一轮后,证明还可以再次进入检查与修正环节,模型由此获得多次推翻和完善答案的机会。

看起来只是多了几道程序,背后的能力变化却很关键。过去评价大模型,经常关注它第一次回答得有多好。而现在,随着任务变得更长、更复杂,一次生成很难覆盖全部情况。模型能否在执行过程中停下来检查,发现偏差并及时修正,正在成为新的能力分界线。

小红书 dots 团队将这种循环称为「递归自我批判」,并将其视为实现递归自我改进(Recursive Self Improvement,RSI)的前提。逻辑并不复杂:模型要先识别出当前答案的问题,后续迭代才有清晰的修正方向。

这也切中了长程复杂任务的一个现实难题。模型具备初步执行能力,可以启动任务;模型能够持续发现错误,吸收反馈并调整方案,任务才更有可能稳定推进下去。

在 IMO 中,模型检查的是一份数学证明。到了现实生活中,它需要持续检查的还有自身对用户、任务和环境的理解。

IMO 夺金之后,AI 面临一场「更长」的考试

数学证明虽然难,仍有明确的题目和专业的评委。现实生活中的任务周期更长、也更多变,很多问题甚至没有统一的评分标准。

在小红书 dots 团队的研究框架中,这些任务可以放在两条坐标轴上观察:一条衡量任务持续多久,另一条衡量结果是否容易验证。像 IMO 这样的数学题以及代码属于短程、可验证的任务,前者有明确的评阅规则,后者可以通过运行结果和测试用例快速获得反馈。

生活任务落在了更长、更模糊的一侧,步骤多、用户需求和外部条件也在不断变化。以装修房子为例,看起来简单的一句话「帮我设计装修方案」,背后可能涉及户型理解、家庭结构、审美偏好、预算分配、材料选择和施工排期。这也是一项天然的多模态任务,模型要读懂户型图、参考图片和施工照片,还要处理报价单、材料清单与聊天记录,等等。

整个过程可能持续数周甚至数月,方案也很难用单一标准评判,预算、审美、耐用性和居住体验往往相互牵制。材料价格低,不一定代表整体选择更优;视觉效果漂亮,也未必住得舒服。模型需要反复权衡,并随情况变化随时调整。

类似的挑战出现在旅行、求职和购物等其他生活场景中。旅行计划需要持续跟踪天气、签证和价格变化;求职要结合个人经历、岗位要求和职业目标反复调整策略;购物则要在预算、偏好、使用场景和商品变化之间不断权衡。场景虽各不相同,对模型 Agent 能力的考察却十分接近:能否串联起多轮交互中的零散信息,识别用户真正重视的偏好与约束,并据此调整后续判断与行动。

这也是 小红书 dots 团队构建VibeAgentBench所要回答的问题。该基准均匀覆盖了旅行、理财、诉讼、装修、求职、健身医疗、备考、租房、购物和团建等10个生活领域,共设计200个任务,接入22个模拟服务后端和288个工具接口,涉及日历、邮件、金融、出行、电商、招聘等真实生活中的常见场景。这些任务的中位持续时间达到29天,最长约111天。评测过程中,环境会持续变化,团队通过7453个脚本事件和超过1.2 万条检查标准,考察 Agent 能否在长期交互中维持目标、响应变化并调整方案。

该基准试图探索出一套适用于复杂生活任务的评价方法:当答案没有唯一标准时,如何判断一个 Agent 究竟做得好不好?

  • VibeLifeBench 主页: https://vibebench.github.io/VibeLifeBench_homepage/
  • 交互 demo:https://vibebench.github.io/VibeLifeBench_livedemo/

这些生活任务与 IMO 其实都在考验一件事:模型提出方案后,还要根据反馈检查问题、修正判断。特别是进入生活场景后,模型需要审视的范围更广:检查方案本身,判断自己是否准确理解了用户,哪些偏好值得保留,哪些需求已经发生变化。

IMO 的 42 分更像是一次阶段性的能力验证,模型已经证明自己能够在边界清晰、结果可验证的任务中完成检查纠错完善闭环。现在,小红书 dots 团队把目光投向了下一场更难的考试:没有固定考期,也没有标准答案

了解更多

猜你想看

← 返回首页