DiG-bench:前沿模型在 70 个隐藏规则游戏中仍远逊人类

Import AI (Jack Clark) · rss · 2026-08-17

Jack Clark 的 Import AI 第 469 期,覆盖三项内容:

1. DiG-bench:测 AI 的「发现力」

来自牛津、普林斯顿、MIT、IDSIA 等机构(作者包括 Juergen Schmidhuber)的新基准 DiG-bench(Discovery in Games)包含 70 个人工设计的微型游戏世界,规则与目标对玩家隐藏,只能通过交互探索发现——类似文字版 ARC。多数游戏保留为私有以防模型训练污染。

成绩分层(Tier 1-7):

2. RSI Simulator 游戏

Paradigm Research 推出浏览器游戏,模拟运营一家追求递归自我改进的 AI 公司,让玩家直观感受研究员 vs 算力的权衡、数据授权等决策。

3. Inherent 的 AI 科学家 Faraday

初创 Inherent 发布论文:在 Qwen-3.6-27B 上后训练出 27B 监督模型 Faraday,控制 Codex 编码 agent 完成「补全论文缺失图表/结果」的任务。其训练集 Replica 由 1990-2026 年的 100 篇论文拆出 310 个复现任务,用 Opus 4.7 生成评分 rubric、Codex Judge 做 GRPO 训练。结果:Faraday+Codex 在 73% 的分布内 ML 任务和 60% 的 held-out AI4Science 任务上击败 Opus 4.8 与 GPT-5.5——显示 AI 系统开始具备「研究品味」。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →