DiG-bench:前沿模型在 70 个隐藏规则游戏中仍远逊人类
Import AI (Jack Clark) · rss · 2026-08-17
Jack Clark 的 Import AI 第 469 期,覆盖三项内容:
1. DiG-bench:测 AI 的「发现力」
来自牛津、普林斯顿、MIT、IDSIA 等机构(作者包括 Juergen Schmidhuber)的新基准 DiG-bench(Discovery in Games)包含 70 个人工设计的微型游戏世界,规则与目标对玩家隐藏,只能通过交互探索发现——类似文字版 ARC。多数游戏保留为私有以防模型训练污染。
成绩分层(Tier 1-7):
- 配合 Claude Code 等 harness 时,Opus 5 与 Fable 5 表现最佳,其后是 GPT-5.5;
- Tier 7(最难)只有 Opus 5 和 Fable 5 能完成 0.2 的任务;Opus 5、GPT-5.5、Kimi K3 借助 harness 可过部分 Tier 6;
- GLM-5.2 和 Gemini 3.1 Pro 只能过 Tier 4 部分关卡;
- 而人类玩家能 100% 通关。Clark 预测模型约在 2027 年中达到人类水平,届时递归自我改进可能真正启动。
2. RSI Simulator 游戏
Paradigm Research 推出浏览器游戏,模拟运营一家追求递归自我改进的 AI 公司,让玩家直观感受研究员 vs 算力的权衡、数据授权等决策。
3. Inherent 的 AI 科学家 Faraday
初创 Inherent 发布论文:在 Qwen-3.6-27B 上后训练出 27B 监督模型 Faraday,控制 Codex 编码 agent 完成「补全论文缺失图表/结果」的任务。其训练集 Replica 由 1990-2026 年的 100 篇论文拆出 310 个复现任务,用 Opus 4.7 生成评分 rubric、Codex Judge 做 GRPO 训练。结果:Faraday+Codex 在 73% 的分布内 ML 任务和 60% 的 held-out AI4Science 任务上击败 Opus 4.8 与 GPT-5.5——显示 AI 系统开始具备「研究品味」。
「漫话AGI」频道最新
- Anthropic CEO 回应负面论调:AI 风险收益论述平衡 — iskander · 2026-08-17
- 观点:OpenAI 重金囤算力,或在憋更强模型等基础设施就绪 — haider1 · 2026-08-17
- Tom Junod:见证是人类唯一做对且 AI 无法之事 — david_perell · 2026-08-17
- AI 安全之争本质是对未来能力的预期差与权力博弈 — JacquesThibs · 2026-08-17
- 石材雕刻老板回应“AI 抢饭碗”:机器人反而创造了就业 — Afinetheorem · 2026-08-17
- Lex Sokolin:模型同质化会让智能体预测市场变成回音室 — LexSokolin · 2026-08-17