Reddit 网友提议用老 Flash 游戏建 AI 推理基准「onemorelevel bench」
BeingBudget8847 · reddit · 2026-09-06
受「模型通关宝可梦耗时」这类基准玩笑启发,一位 Reddit 用户提议建一个更广的基准:用 onemorelevel.com 上的经典 Flash 小游戏测试模型在多种简单游戏上的表现与推理能力,思路类似 Arc AGI,希望以游戏多样性衡量模型的泛化推理。
「研究」频道最新
- 只用 1 条提示词做 on-policy 蒸馏,可达 1.7 万条数据的 71.5% 效果 — burkov · 2026-09-06
- 3.25 小时完成 96 质粒酵母转化,Pylabrobot 自动化生物实验亮相 — nlarusstone · 2026-09-06
- BioTorch 公测上线:116 道 PyTorch 练习铺路生物 AI — yawnxyz · 2026-09-06
- ECCV 2026 eXCV 工作坊 9 月 8 日探讨基础模型时代的可解释性 — CSProfKGD · 2026-09-06
- ETH Zurich 测试百名开发者:文字表达力是 vibe coding 关键预测指标 — _akpiper · 2026-09-06
- 实测 ChatGPT 与 Claude 生成数学动画,两者都已达到可用水准 — PTenigma · 2026-09-06