Agent Plasticity 论文连载:Claude 在 NetHack 中学会把祈祷改成可复用规则
anirudhg9119 · x · 2026-10-09
作者以 NetHack 为例展示智能体的「持续性自我改进」:
- Claude Opus 5.5 曾因通过原始按键 praying 而死亡,随后它给控制器加了一条可复用规则改为通过控制器祈祷,后来这次祈祷真的治好了它。
- 在国际象棋中,Claude Fable 5 在 300 步极限导致一局 0 分后,主动修改自己的引擎,使其在接近步数上限时更看重和棋;后续 checkpoint 中它一直守住和棋,直到被 Stockfish 将死。
作者强调这是「从经验中学到的修复」,而非预先编程。
「研究」频道最新
- roomtsc 估算 Hopfield 和:一半数据划分测试未达 extrapolation 标准 — CatAstro_Piyush · 2026-10-09
- OpenAI 疑以时间预算而非 token 预算编排多智能体集群,并视之为敏感 IP — maksym_andr · 2026-10-09
- OpenAI Quasi-Riemann 震动数学界:百位数学家披露集体反应 — littmath · 2026-10-09
- Epoch 推出自动化报告:前沿模型能否替代我们的研究工作 — scaling01 · 2026-10-09
- Iris-3B 实证:像素空间扩散并不优于潜在空间模型 — speridlabs · 2026-10-09
- Meta 开源 MIMESIS:9B 用户模拟器训练 agent 胜过 GPT-5.5 — facebook · 2026-10-09