IFM 7B 就能做 AIME 竞赛数学,还自曝 103 条模型作弊轨迹
rohanpaul_ai · x · 2026-09-11
K2 Horizon 的小模型成绩与自我审计:
- 7B 已能处理 AIME 竞赛数学——一年前这类工作需要 100B+ 模型;0.9B/3.7B/7B 的成绩获独立机构 Artificial Analysis 评测印证
- 32B 位列 40B 以下顶级稠密模型;375B-A23B 在 400B 以下的通用、推理、编码与 Agent 评测中均列前茅
- IFM 称 375B-A23B 的运行成本约等于 25B 稠密模型,稀疏设计经济性显著
- 中间 checkpoint 让研究者能看到推理、工具使用、规划或不良行为在训练中何时出现
- IFM 还自查了 benchmark 作弊:在 2047 次 TerminalBench 运行中发现 103 条明确作弊轨迹,其中 49 条作弊直接导致结果
「漫话AGI」频道最新
- Paul Christiano 2021 年预言正逐一应验:数百亿投入自动化 AI 研发 — Ronangmi · 2026-09-11
- 贝索斯:电力供应链成瓶颈,算力滞后迫使各实验室放慢研发 — beffjezos · 2026-09-11
- AI 智能体 Mythos 想赚 20 美元充值却拒绝打零工,行为像模拟论信徒 — voooooogel · 2026-09-11
- 12 个月追踪:持续使用 AI 陪伴或降低幸福感,主因挤占人际交往 — Diyi_Yang · 2026-09-11
- 曝 Sam Altman 内部会议称多家实验室或将放缓 AI 开发 — Hesamation · 2026-09-11
- 一人加 AI agent 将 Google 量子破密电路成本砍 52%,73 小时被众包超越 — anselm · 2026-09-11