Reddit 网友提出用 Jev 类封闭决策模型根治数据集打标签幻觉

Iory1998 · reddit · 2026-09-21

Reddit 用户 Iory1998 提出一个数据集打标思路:利用 TypeSafe Jev 这类「封闭决策模型」替代 LLM 自由生成 caption。

问题:让 LLM 给图片打 Danbooru 标签会 hallucinate 词表外的伪标签,且跨批次漂移严重;而 Illustrious、Anima 等模型只对学过的标签响应,词表准确性是全部关键。

方案核心:把开放式提问反转为一组封闭问题(照片还是插画?发色是蓝/黑/金?人物 0/1/2/3+?),模型单次前向传播只从给定状态列表中选择并输出概率,超过阈值才写入 caption——保证每个维度必答、零编造标签。为省算力,先用廉价模型初筛候选标签,再用 Jev 类模型逐个确认;最后把冻结的标签列表交给 LLM 纯做翻译生成自然语言描述,一次打标同时产出 Booru 标签串和 prose 描述,兼容两种训练架构。

已知局限:可能确认一个真实但不在图中的标签(错而不假),阈值是召回与精度的调节旋钮。整个流程可在 ComfyUI 内实现,无需微调打标模型或 API。作者尚未动手,欢迎已实现者反馈。

所属事件:Reddit 网友提议用封闭决策模型根治数据标注幻觉(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →