复旦 IDSpect:按偏旁部首拆字给奖励,提升中文文字生成结构准确率
Fudan-University · hf · 2026-10-01
- 文生图模型渲染准确中文仍是难题:现有基于 OCR 的 RL 奖励把每个汉字当原子比较,无法区分偏旁级别的结构错误,模型只需「形似」即可得分。
- 复旦提出 IDSpect:用 Ideographic Description Sequence(IDS,含空间算子与部件)表示汉字结构,训练专家 IDS 识别器把渲染文本转录为 IDS token;奖励时将目标文本确定性分解为 IDS 序列,与裁剪区域的视觉 IDS 预测对齐,配合整字语义奖励提供部件级+空间关系细粒度 credit。
- 不改动图像生成器、不增加推理开销;用于 Qwen-Image 的 GRPO 后训练,在 LongText 和 GenTextEval 上取得领先的结构质量与语义对齐成绩。
「多模态」频道最新
- Seedance 2.5 实测:动漫级双刀打斗搬进写实电影感 — SimplyAnnisa · 2026-10-01
- Midjourney --sref 3896456162 复刻 70 年代柯达胶片迪斯科质感 — michaelrabone · 2026-10-01
- LoRA 训练完成≠学到了风格:一套可复现的 SDXL 验证流程 — no3us · 2026-10-01
- 剪辑师开源 open-fusion-mcp:Claude 直接在达芬奇里做可编辑动效 — JohnnyLegion · 2026-10-01
- Raven Noire 边听哥特音乐边写日记的 AI 视频片段 — Street-Pound5762 · 2026-10-01
- 破解 MiniMax H3 VAE 细节上限失败,却意外产出 2X 细节增强方案 — NoMouse9610 · 2026-10-01