视觉编码 agent 评测设计:重渲染+确定性判分如何修正厂商差异
smith2008 · reddit · 2026-10-02
同一作者公开了 photo-to-Blender 基准的评测设计细节,重点是「别信模型交上来的东西」:
- 自己重渲染:打开模型交付的场景文件、按原图长宽比渲染,不采信模型自报。
- 不用 LLM 评审:轮廓重叠(30%)+边缘 F1(40%)+多尺度 RGB 误差(15%)+网格健康度(15%,非流形/开边/重复面等),经分段线性映射到 0-100,是对比刻度而非场景还原百分比。
- 防作弊:35° 摆角第二渲染曝光平面替代品;场景引用的每张图片按摘要比对防直接贴原图。
- 失败计入均值:没交付场景就打 0 且留在平均分里。
- 管道拉平:Anthropic 加 cache-control、Google 加收尾 user turn,否则行为异常;修复前 Claude 0% 缓存而 OpenAI 96%。
- 条件冻结:上限、图片、brief 摘要、评分权重随榜单存档。
结果(三图均值):GPT-6 Astra 66($3.91)、GPT-6.1 Sol 61($0.36)、Claude Opus 5.5 60($1.19)、Sonnet 5.5 56($0.50)……GLM 5.3 Flash 36($0.089);DeepSeek V4.1 Flash 与 Qwen3.8 Max 得 0(20 分钟未保存)。
下一步改进:头部模型每图跑三次看方差,以及换模型中立的 agent 循环(有三个模型跑在自家 CLI 里)。
「编程与Agent」频道最新
- Mirelo 接入 AWS 的 Kiro IDE,AI Agent 可直接生成音效 — ordax · 2026-10-02
- 每天用 Codex 八小时仍有大量额度,网友晒图惊呼“你们怎么用得完” — honkballs · 2026-10-02
- GitHub 1.8 万星免费 Harness Engineering 课程:14 讲+8 实战项目 — Hesamation · 2026-10-02
- 开源项目 Manifesto:让 UI 与 Agent 走同一套应用内操作规则 — TraditionalListen994 · 2026-10-02
- 安全通告里的 void* 指针:AI 正在翻 Linux 内核旧代码 — mircomusolesi · 2026-10-02
- A2A 协议声量高落地少:多数团队仍停留在评估阶段 — Diarnstinc_Crew_6510 · 2026-10-02