全页手稿转写时代,CER 为何失效:从行级 CRNN 到整页布局决策

vanstriendaniel · x · 2026-09-04

vanstriendaniel 解释了 CER 指标的失效逻辑:过去 CER 适合行/词级评测,因为 CRNN+CTC 模型词表固定、无格式、无阅读顺序和版面问题,几乎没有约定可争议;而如今任务是整页转写,模型要做几十种风格决策,而十年前的 ground truth 只采用其中一种写法,CER 会把所有这些差异都计为「阅读错误」。如果基准仍在行/词级,CER 还有部分适用空间。

这是中世纪手稿转写模型评测讨论的延续,作者也提到这是在评测稀缺领域对既有方法的务实沿用,未来会尝试其他评测方案。

所属事件:0.8B Qwen 微调转写两千份中世纪手稿,CER 指标引争议(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →