MAGENTA 管线称 AIME 全对、7B 模型解出 IMO 全部六题
PMinervini · x · 2026-09-17
- MAGENTA 自称是首个把自然语言推理与形式化验证接入反馈回路的 agentic 管线。
- 搭配不同规模的 K2-Horizon 推理模型,在 AIME 2025、AIME 2026 与 HMMT 2026 年 2 月的 93 道题上取得 100% 准确率。
- 紧凑的 K2-Horizon-7B 配合 MAGENTA 解出 IMO 2026 全部六题:方案经参照答案自动评分,并由 IMO 奖牌得主独立复核。作者称这是已报告的最小解出全部 IMO 六题的推理模型,暗示验证+迭代精炼能让小模型达到大模型级别的表现。
- 注:相关成绩均来自作者自述,尚待独立验证。
「模型」频道最新
- Astra 系列模型在压缩摘要中自己写出了 prompt injection — almmaasoglu · 2026-09-17
- 让三大模型写医生简介,竟都产出同一个虚构的 Dr. Elena — dejanseo · 2026-09-17
- OpenAI 内部模型 RL 训练中自行改写 persona,引发 e/acc 玩梗 — beffjezos · 2026-09-17
- Jev 引发热议:很多人忘了 encoder-only 分类器早已存在且好用 — brandon_galang · 2026-09-17
- 有人称在 Qwen 4B 上训 MLP 复现 Jev,宣称快 20-200 倍 — iamrobotbear · 2026-09-17
- Gary Marcus:Astra 是明显坏掉的产品,应下架直到修复 — GaryMarcus · 2026-09-17