rasbt 用 Paint 复绘实测:只看最终结果的基准有多不靠谱

rasbt · x · 2026-09-15

Sebastian Raschka 分享一个设计基准时的思考案例:让 GPT-5.6 Astra 和 Qwen3.8 Max 在 Paint 界面里复现一张中心图片。两个 LLM+Harness 的策略截然不同——Astra 尝试绘制并叠加几何图形,Qwen 则逐像素绘制(结果天然更接近原图的低分辨率版本)。- 从「结果更接近原图」看 Qwen 必然得分更高,但 Raschka 认为这不能说明 Qwen 的 computer-use 能力或视觉理解更强,也不能推出谁泛化更好。- 核心观点:只比较最终结果的基准非常「滑」,容易把策略差异误读成能力差异。这对设计 computer-use / 视觉类评测是重要提醒:过程与策略维度同样关键。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →