324 盘国际象棋实验:给 LLM 记笔记无助于避免低级失误

marvijo-software · reddit · 2026-10-12

作者让 GPT-6.1 Sol、Claude Sonnet 5.5 和 DeepSeek V4.1 Flash 跨 31 届锦标赛、324 盘棋互相博弈并对战浅层搜索的 Stockfish,每盘后让模型写「学习笔记」并在下一盘读回(也可读其他模型的笔记)。结果:GPT-6.1 Sol 2 胜 9 和 49 负,Claude 0 胜 19 和 33 负,DeepSeek 0 胜 3 和 51 负,成绩没有上升趋势。关键发现:- 首个大失误几乎总是第 13-16 步左右留下无防守的子,不是深层战术;- 笔记几乎从未导致也从未阻止这类失误,失误引用记忆开局的场景每模型仅 0-4 盘;- 笔记被模型塞满开局着法,作者不得不限制条数;- 给棋盘图片反而不如文本局面。结论:笔记能当记忆用,但解决不了「棋盘视觉」——模型知道计划,却看不见自己的马正被白吃。笔记文件开源:github.com/marvijo-code/ai-chess-agent-memory。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →