Reddit 在比 Qwen3.5-VL、InternVL 和 Gemma 4 的图像描述能力
TekeshiX · reddit · 2026-08-04
作者想找一个能准确描述图片内容的 LLM/VLM,尤其是能处理 NSFW / 无遮罩图片 的版本。
- 他们之前用 Gemini+越狱提示词做图片描述,但现在 Gemini 会直接拦截这类图片。
- 候选项包括 Qwen3.5-VL、InternVL、Gemma 4,以及是否需要官方版之外的 uncensored/abliterated/heretic 变体。
- 还提到 JoyCaption 体验不稳定;希望模型能在 16–48GB 显存 内运行,是否支持 ComfyUI 不是关键。
所属事件:开发者探讨寻找无审查的图像描述大模型(2 条相关)→
「模型」频道最新
- 开源模型的一大优势仍是能看推理链 — jamesdouma · 2026-08-04
- opencode 下拉菜单里出现了加拿大模型 — yacineMTB · 2026-08-04
- DeepSeek v4 Flash 将测试 ChatGPT 因道德拒答的任务 — yacineMTB · 2026-08-04
- Kimi 被夸能做长程编码,而且表现得更“听话” — casper_hansen_ · 2026-08-04
- llama.cpp 补丁把 DeepSeek-V4-Flash-0731 提速到 25.91 tok/s — dyn___ · 2026-08-04
- Qwen3.8-Max 在 Vision Arena 视觉榜单排第 2,仅差 13 分 — arena · 2026-08-04