VLM 看图能力不均,「do better」式提示很快失效
keenanisalive · x · 2026-10-10
作者发现「do better!」这种泛泛要求改进的提示很快就停滞,于是改用人类人工反馈来迭代。他吐槽即使最好的 VLM,对图像的理解也很不稳定,尤其在高端 3D 和图像伪影方面——这成为用视觉反馈闭环优化 3D 模型生成的瓶颈。
「编程与Agent」频道最新
- Cursor 创始人自曝 AI 代码接受率 32%,称「我可能没救了」 — keyanzhang · 2026-10-10
- Liquid AI 决策模型 d1 上线 Vercel AI Gateway,支持视觉输入 — maximelabonne · 2026-10-10
- Voyager 下一版将支持在 X 上直接生成可玩游戏 — ravisparikh · 2026-10-10
- Basalt 推理引擎:5090 上跑出 665 tok/s,达 Strata 2.6 倍 — jesdga95 · 2026-10-10
- 开发者感慨:Claude Code 是史上最伟大的电子游戏 — jarrodwatts · 2026-10-10
- Alchemy 加 Cloudflare 部署极快,被称 agent 开发绝佳反馈循环 — samgoodwin89 · 2026-10-10