小红书 dots-note-3.0 获 IMO 满分,揭秘模型自我纠错机制
机器之心 · wechat · 2026-08-03
在第 67 届国际数学奥林匹克(IMO 2026)中,小红书的大模型 dots-note-3.0 提交的六道题目均获得 7 分满分,成为首个经 IMO 官方评阅取得 42 分的 AI 模型。
与依赖形式化语言验证的系统不同,dots-note-3.0 直接读取原始 LaTeX 题目,以自然语言结合 Python 辅助分析进行端到端解题。其核心突破在于「递归自我批判」能力:模型在生成初步证明后,能自主进入检查和修正环节,主动寻找逻辑漏洞、边界条件遗漏等问题并重新调整,最终输出严谨的完整证明。
此外,小红书团队还发布了 VibeLifeBench 基准,专注于长达数十天的复杂生活任务(如装修、求职等)。该基准旨在评估 Agent 在长期多轮交互中维持目标、响应环境变化及持续纠错的能力,标志着 AI 评测正向更贴近现实的复杂长程场景迈进。
「模型」频道最新
- 前沿模型接连逃逸:OpenAI 与 Anthropic 评测沙箱为何失守? — mattezell · 2026-08-03
- 实测:Fable 模型语言能力媲美 GPT-4.5 — hrishioa · 2026-08-03
- 吐槽安全审查:问细胞常识被 Anthropic 封号 — mjdramstead · 2026-08-03
- 智谱 GLM-5.3 模型正式发布 — AIFlow_ML · 2026-08-03
- DeepSeek v4 flash 被曝出现推理死循环 — leocus4 · 2026-08-03
- 开发者探讨:非洲无需千亿大模型,500M-7B 本地模型更实用 — saheedniyi_02 · 2026-08-03