Epoch AI 推出全新游戏谜题基准,测试大模型推理能力
Jsevillamol · x · 2026-08-07
Epoch AI 发布了一项名为“游戏谜题”的新基准,用于测试大模型的推理能力。该基准类似于国际象棋谜题测试,但使用了来自另一款未公开游戏的谜题,旨在评估模型在可能未经大量专门后训练的任务上的表现。目前该基准的最高纪录保持者为 Claude 3 Opus,得分 59%。
「模型」频道最新
- 强拟人化假设被打破:RL 正塑造更连贯的 AI 智能体 — voooooogel · 2026-08-07
- 传字节跳动正筹备训练 5 万亿参数大模型 — scaling01 · 2026-08-07
- 分析指 GPT-6 若结合庞大预训练与 OpenAI 后训练优势将迎突破 — haider1 · 2026-08-07
- 月之暗面 Kimi K3 开源模型上线 Databricks,强化企业级数据应用 — matei_zaharia · 2026-08-07
- Keras 社区会议预告:本周五将展示全新 vLLM 集成 — fchollet · 2026-08-07
- Artificial Analysis 模型评测榜单更新 — teortaxesTex · 2026-08-07