LLM 游戏能力基准 TALES 获 NeurIPS 2026 接收
tw_killian · x · 2026-09-29
研究者 ccui9 宣布其 TALES 基准被 NeurIPS 2026 接收。该工作研究的核心问题是「LLM 玩游戏的能力到底如何」。作者提到 arXiv 上的论文版本已略过时,团队已补充了大量新模型的成绩(包括 Astra 和 Opus 5.5),将尽快更新。
「研究」频道最新
- UCLA 获 2500 万美元联邦资助,主导评测 AI 阿尔茨海默诊断工具 — chrismattmann · 2026-09-29
- 研究者点破 LLM 验证软肋:「核查」无法形式化保证 — anshulkundaje · 2026-09-29
- Foresight 旧金山办 AI 科学大会,DeepMind、MIT 等多方出席 — juanbenet · 2026-09-29
- MetaLint 论文:Qwen3-4B 代码 lint 检测 F 值提升 2.7 倍,媲美 o3-mini — dan_fried · 2026-09-29
- 国际象棋 AI 对手怎么「输得像人」?开发者探讨可信失误的设计难题 — space64-llc · 2026-09-29
- Aether AI 发布 16B 参数 CausalWM,让世界模型先推理因果再生成未来 — jiqizhixin · 2026-09-29