rasbt 用 Paint 复绘实测:只看最终结果的基准有多不靠谱
rasbt · x · 2026-09-15
Sebastian Raschka 分享一个设计基准时的思考案例:让 GPT-5.6 Astra 和 Qwen3.8 Max 在 Paint 界面里复现一张中心图片。两个 LLM+Harness 的策略截然不同——Astra 尝试绘制并叠加几何图形,Qwen 则逐像素绘制(结果天然更接近原图的低分辨率版本)。- 从「结果更接近原图」看 Qwen 必然得分更高,但 Raschka 认为这不能说明 Qwen 的 computer-use 能力或视觉理解更强,也不能推出谁泛化更好。- 核心观点:只比较最终结果的基准非常「滑」,容易把策略差异误读成能力差异。这对设计 computer-use / 视觉类评测是重要提醒:过程与策略维度同样关键。
「模型」频道最新
- Reddit 用户吐槽:Astra 编码远不如前代 Sol — Every_Assignment_111 · 2026-09-15
- 研究者反驳「模型已能察觉被研究」论:模型只是被动计算元件 — vishalmisra · 2026-09-15
- 把 DeepSeek 默认搜索换成 Exa,V4.1 Flash 稳到旗舰级 — bookwormengr · 2026-09-15
- Google AI Overview 成「越狱助手」,自动以创作项目名义给有害指引 — conitzer · 2026-09-15
- Solar Pro 4 免费体验延长至 9/25,限 Nous Portal 独家 — keunwoochoi · 2026-09-15
- Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率,强模型仅涨 1-2 分 — PawelHuryn · 2026-09-15