324 盘国际象棋实验:给 LLM 记笔记无助于避免低级失误
marvijo-software · reddit · 2026-10-12
作者让 GPT-6.1 Sol、Claude Sonnet 5.5 和 DeepSeek V4.1 Flash 跨 31 届锦标赛、324 盘棋互相博弈并对战浅层搜索的 Stockfish,每盘后让模型写「学习笔记」并在下一盘读回(也可读其他模型的笔记)。结果:GPT-6.1 Sol 2 胜 9 和 49 负,Claude 0 胜 19 和 33 负,DeepSeek 0 胜 3 和 51 负,成绩没有上升趋势。关键发现:- 首个大失误几乎总是第 13-16 步左右留下无防守的子,不是深层战术;- 笔记几乎从未导致也从未阻止这类失误,失误引用记忆开局的场景每模型仅 0-4 盘;- 笔记被模型塞满开局着法,作者不得不限制条数;- 给棋盘图片反而不如文本局面。结论:笔记能当记忆用,但解决不了「棋盘视觉」——模型知道计划,却看不见自己的马正被白吃。笔记文件开源:github.com/marvijo-code/ai-chess-agent-memory。
「编程与Agent」频道最新
- Matthew Berman:我已经不装 App 了,直接让 Agent 干 — MatthewBerman · 2026-10-12
- Pedro Domingos 点评:Harness 成了当下 AI 圈的风口 — pmddomingos · 2026-10-12
- AI 时代初级工程师怎么成长为资深?行业缺失的一环 — KlausCodes · 2026-10-12
- Garry Tan 转发观点:个人软件仍是「用完即弃」,自主维护的 Agent 是关键 — garrytan · 2026-10-12
- 冷知识:只有<head>里的样式表才阻塞渲染,<body>里的不阻塞 — steren · 2026-10-12
- TikTok 抵制 AI 版 Photoshop,Adobe 前员工:闭源代码没人看得懂 — jasonkneen · 2026-10-12