视觉编码 agent 评测设计:重渲染+确定性判分如何修正厂商差异

smith2008 · reddit · 2026-10-02

同一作者公开了 photo-to-Blender 基准的评测设计细节,重点是「别信模型交上来的东西」:

结果(三图均值):GPT-6 Astra 66($3.91)、GPT-6.1 Sol 61($0.36)、Claude Opus 5.5 60($1.19)、Sonnet 5.5 56($0.50)……GLM 5.3 Flash 36($0.089);DeepSeek V4.1 Flash 与 Qwen3.8 Max 得 0(20 分钟未保存)。

下一步改进:头部模型每图跑三次看方差,以及换模型中立的 agent 循环(有三个模型跑在自家 CLI 里)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →