返回新闻列表
2026-07-23 09:06

​小红书大模型 IMO 满分夺金:中国 AI 首次登顶数学奥赛,第三题解法让冠军选手直呼优雅

文章提及的 AI 工具Gemini
文本核心速览
  1. 满分夺金创纪录小红书大模型 dots-note-3.0 在第67届IMO中六题全对,以42分满分夺得金牌,成为中国首个获IMO官方金牌认证的大模型,也是全球继谷歌Gemini之后第二个达到该成绩的大模型。
  2. 赛题难度高于往年本届IMO金牌线为29分,较去年35分下降6分,说明赛题整体得分难度明显提升。dots-note-3.0以满分42分超越金牌线13分,展示出稳定且强大的推理能力。
  3. 第三题解法获专家盛赞第三题为组合博弈问题,dots-note-3.0采用归纳法而非常规图论转化,抓住本质结构。双CMO金牌得主刘涵祚评价其“正确且漂亮”“简洁优雅”,汪千桐称其“直击本质”。
  4. 技术亮相与开源计划满分成绩证明小红书已具备可迁移的通用推理能力,基础模型实力获国际权威验证。据悉,dots-note-3.0即将开源,意味着基础模型领域出现值得关注的新玩家。

dots-note-3.0在IMO2026拿满分金牌,比金牌线高13分

小红书dots-note-3.0在第67届国际数学奥林匹克竞赛(IMO2026)上以六道题全部答对的满分42分拿下金牌,成为继谷歌Gemini之后全球第二个达到IMO官方金牌水平的大模型——而且直接拿了满分,谷歌此前只答对5/6题(差7分)。这是中国大模型首次获得IMO官方金牌水平认证。IMO每年汇聚全球顶尖中学生,陶哲轩等半数当代菲尔兹奖得主都出自这个赛事。比赛分两天,每天4.5小时做3道题,覆盖代数、组合、几何和数论四个方向,每题7分,必须写出逻辑完整、可接受逐步审查的证明过程——对大模型来说难度极高。

谷歌Gemini的追赶作为参考

群里在传谷歌Gemini的IMO战绩:2024年首次挑战时只拿到28分银牌,而且需要先把题目翻译成Lean等形式化语言,部分题目耗时数天;2025年用Gemini Deep Think以自然语言端到端完成证明,4.5小时内解决5道题拿到金牌。数学竞赛被看作大模型智力与推理能力的试金石,而IMO相比常规Benchmark有个独特优势——未知性。每届赛题由专家命制并严格保密,模型没法提前针对性训练,只能靠实时理解、探索和严密推理。

本届难度高于去年,满分含金量更重

本届IMO金牌线定在29分,比去年的35分低了6分——意味着整套赛题得分难度明显高于去年。29分相当于完整解决4道题,再从剩余两题里拿1分就能进金牌区间,而dots-note-3.0全部答对,比金牌线整整多出13分。满分首先证明的是Agentic推理系统的稳定性:模型得读懂自然语言条件,判断关键信息,提出中间结论,并组织成完整证明,任何条件误读或推导跳步都会被评审直接揪出来。dots-note-3.0在六类不同问题中连续拿满,说明表现不是靠某道题的偶然灵感。

技术亮点:自然语言端到端+智能体+递归自我批判

模型直接以自然语言端到端处理,从问题理解到答案表达形成完整闭环,意味着它拥有可迁移的通用推理能力。具体答题时,dots-note-3.0采用智能体方式,结合自然语言和Python代码执行推理解题,还借助递归自我批判能力审视自身论证。真正让人意外的是第三题——一道组合博弈问题。常见解法是把原问题转化为图论连通性问题再建证明,但dots-note-3.0改用归纳法,抓住了问题最本质的结构,设计出恰到好处的归纳对象与命题。双CMO金牌得主刘涵祚评价它"正确且漂亮,结构紧凑、逻辑自然,即使放在IMO解答中也属于较为简洁优雅的一类"。CMO金牌得主汪千桐说它"简洁明了而且直击本质,每一步都顺理成章,但人类选手很难想到能从这个角度切入"。

这次亮相让谁难受

对小红书来说,IMO满分是一次重要的技术亮相。过去外界对它的技术认知集中在内容社区、推荐算法和内容理解,基础模型领域的位置一直缺公开权威的证明。IMO满分不一样——42分就摆在那里,不需要复杂解释,足以证明小红书已经具备值得行业认真审视的基础模型能力,基础模型领域出现了一个值得关注的新玩家。有消息称,dots-note-3.0即将开源。接下来盯着看:开源后开发者能不能直接复现它的推理能力?其他国产大模型(比如阿里、百度、智谱)会不会被逼着赶紧刷IMO分数来比拼?

来源: aibase阅读原文

其他新闻

查看全部