新 ViT 动漫打标模型:超越 WD-tagger v3
darkth0ughts · reddit · 2026-08-12
开发者基于 DINOv3 ViT 骨干网络与交叉注意力机制,从零开始训练了一款新的动漫图像打标模型。
- 架构创新:采用 Tag Query Head,并在 Danbooru2025 数据集上完成训练。
- 性能对比:在包含 3383 个标签的独立测试集上,新模型(L/16 版本)取得了 0.5352 mAP 的成绩,相比社区主流的 WD-eva02-large-tagger-v3 提升了 +0.053 mAP,同时推理延迟更低。
- 资源开放:提供了 Hugging Face 在线 Demo 空间和模型卡片。
「多模态」频道最新
- AI音乐分析产品亮相:自动提取歌曲高光片段 — threepointone · 2026-08-12
- 实测 MiniMax 视频生成:特写镜头 3 秒后角色必崩 — ItsMilaVoss · 2026-08-12
- LTX 2.5 实测:4080 显卡 8 分钟生成 15 秒 1080P 视频 — skyrimer3d · 2026-08-12
- MiniMax H3 本地跑全身镜头脸部融化,8G 显存遇精度瓶颈? — Loud-Guitar1920 · 2026-08-12
- 东西方审美差异如何影响视频模型评价?H3 与 LTX 2.5 对比 — xbobos · 2026-08-12
- AI视频极限测试:暗黑英雄概念展现电影级光影与物理效果 — eyishazyer · 2026-08-12