小红书 dots-note-3.0 获 IMO 满分,揭秘模型自我纠错机制

机器之心 · wechat · 2026-08-03

在第 67 届国际数学奥林匹克(IMO 2026)中,小红书的大模型 dots-note-3.0 提交的六道题目均获得 7 分满分,成为首个经 IMO 官方评阅取得 42 分的 AI 模型。

与依赖形式化语言验证的系统不同,dots-note-3.0 直接读取原始 LaTeX 题目,以自然语言结合 Python 辅助分析进行端到端解题。其核心突破在于「递归自我批判」能力:模型在生成初步证明后,能自主进入检查和修正环节,主动寻找逻辑漏洞、边界条件遗漏等问题并重新调整,最终输出严谨的完整证明。

此外,小红书团队还发布了 VibeLifeBench 基准,专注于长达数十天的复杂生活任务(如装修、求职等)。该基准旨在评估 Agent 在长期多轮交互中维持目标、响应环境变化及持续纠错的能力,标志着 AI 评测正向更贴近现实的复杂长程场景迈进。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →