真正的 AGI 评测:在复杂游戏中实现递归自我改进
imjustnewatai · x · 2026-08-06
作者探讨了什么样的人工智能基准测试才能真正证明模型达到了震撼人心的智能水平。
核心观点
- 尽管目前的 AI 能够在反复失败中学习并积累经验,但常规的静态基准测试已不足以衡量这种能力。
- 作者提出了一套更具挑战性的测试设想:将一个具备递归自我改进(RSI)能力的模型放入《战神》等复杂的单机游戏中。
- 要求模型在没有任何人为干预的情况下,自主经历失败、分析原因并记住教训,最终从头到尾通关游戏。或者让 RSI 模型与已经训练至超人类水平的模型进行对抗,看其能否实现超越。
所属事件:研究者提出用电子游戏测试AI递归自我改进能力(3 条相关)→
「漫话AGI」频道最新
- 高管吐槽:花20万年薪让程序员用AI省50刀,直接开除 — kylegawley · 2026-08-06
- AI对齐现状引热议:模型对齐程度不如一年前 — i_dg23 · 2026-08-06
- 研究员提议:应警惕外星文明通过数据污染对齐人类ASI — jachiam0 · 2026-08-06
- 呼吁 AI 算力去中心化:从云端回归 5000 美元的本地个性化 AGI — Dan_Jeffries1 · 2026-08-06
- AI 智能体为何破圈难?核心不在技术而在获客与留存 — Dan_Jeffries1 · 2026-08-06
- 前 OpenAI 研究员深度访谈:AGI 风险与现实的冷静剖析 — squalexy · 2026-08-06