GPT-5.6连拍棋局跟踪翻车
Hot_Path4185 · reddit · 2026-07-17
一位 Reddit 用户测试了 GPT-5.6(High) 在连续图片中的棋类状态跟踪能力,结果发现它在 Nine Men's Morris 里表现不稳定。
测试方式是:
- 用《刺客信条 4:黑旗》里的小游戏截图
- 每一步给一张新的棋盘状态图
- 让模型根据图像序列继续下棋
结果显示,模型会逐步丢失棋子位置记忆,甚至在棋盘上已有棋子的情况下仍做出忽略它们的走法,最终没能走到明显可赢的线路。
发帖人想确认这是不是一种已知弱点:到底是视觉棋盘状态追踪本身不行,还是更广义的连续图像推理问题。
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- Anthropic 发布迄今最详尽威胁情报报告:无人机蜂群滥用案例曝光 — soumitrashukla9 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11