彩铅绘画实测显示,模型会画却不会停在最佳时刻
新智元 · wechat · 2026-07-25
TryAI 做了一个“彩铅绘画竞技场”:让四个视觉模型用同一套工具,一笔一笔去临摹《蒙娜丽莎》《星月夜》,再完成 5 个开放式绘画命题。
这项实验怎么测
- 不是文生图,而是智能体式绘画:模型要自己规划、看画布、调颜色/笔刷/力度、涂抹、擦除,并决定何时停笔。
- 临摹题用 SSIM 做客观评分;开放式题没有参考图,只能靠人工判断。
- 整套框架开源在 GitHub,别人可直接换目标图复跑。
结论很反直觉
- 没有一个模型能在最终交卷时超过自己中途的最好版本,几乎都是“改着改着改坏了”。
- 自查次数更多,并不代表结果更好。Gemini 检查最勤,但从峰值到最终稿的跌幅也最大。
- 在 TryAI 的主观评估里,GPT-5.6 Sol综合最好;Claude Fable 5排第二,但更慢、也贵得多。
- Grok 4.5调用了最多 token,但大部分是缓存读取,所以账单反而不高。
成本对比
- GPT-5.6 Sol:$7.74,总平均 6.2 分钟,29 步
- Claude Fable 5:$160.58,总平均 12.5 分钟,54 步
- Grok 4.5:$9.21,总平均 4.8 分钟,99 步
- Gemini 3.6 Flash:$12.87,总平均 6.9 分钟,73 步
这篇文章的核心洞见是:模型已经会“看”自己的输出,但还不会稳定地判断什么时候该停。在多步创作里,停笔能力和规划能力一样重要。
「多模态」频道最新
- 8.2 版本用“维多利亚女士”提示词生成精致人像 — LudovicCreator · 2026-07-25
- 创作者比较 Flux.2 Klein 与 Z-Image Turbo 的旅行写实生成 — RN-Red-011989 · 2026-07-25
- Midjourney 把环法改造成波普风骑行海报组 — gizakdag · 2026-07-25
- Leonardo 用参考视频接 Seedance 2.0 做无缝续视频 — techhalla · 2026-07-25
- Midjourney 每日提示词练习沉淀出五种风格配方 — tisch_eins · 2026-07-25
- ComfyUI 用户在讨论 Illustrious 角色一致性工作流 — sparereddit1234 · 2026-07-25