VLM 看图能力不均,「do better」式提示很快失效

keenanisalive · x · 2026-10-10

作者发现「do better!」这种泛泛要求改进的提示很快就停滞,于是改用人类人工反馈来迭代。他吐槽即使最好的 VLM,对图像的理解也很不稳定,尤其在高端 3D 和图像伪影方面——这成为用视觉反馈闭环优化 3D 模型生成的瓶颈。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →