Epoch AI 推出全新游戏谜题基准,测试大模型推理能力

Jsevillamol · x · 2026-08-07

Epoch AI 发布了一项名为“游戏谜题”的新基准,用于测试大模型的推理能力。该基准类似于国际象棋谜题测试,但使用了来自另一款未公开游戏的谜题,旨在评估模型在可能未经大量专门后训练的任务上的表现。目前该基准的最高纪录保持者为 Claude 3 Opus,得分 59%。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →