全页手稿转写时代,CER 为何失效:从行级 CRNN 到整页布局决策
vanstriendaniel · x · 2026-09-04
vanstriendaniel 解释了 CER 指标的失效逻辑:过去 CER 适合行/词级评测,因为 CRNN+CTC 模型词表固定、无格式、无阅读顺序和版面问题,几乎没有约定可争议;而如今任务是整页转写,模型要做几十种风格决策,而十年前的 ground truth 只采用其中一种写法,CER 会把所有这些差异都计为「阅读错误」。如果基准仍在行/词级,CER 还有部分适用空间。
这是中世纪手稿转写模型评测讨论的延续,作者也提到这是在评测稀缺领域对既有方法的务实沿用,未来会尝试其他评测方案。
所属事件:0.8B Qwen 微调转写两千份中世纪手稿,CER 指标引争议(4 条相关)→
「研究」频道最新
- VI3 用 IMU 惯性数据给 3D 基础模型补上真实尺度 — zhenjun_zhao · 2026-09-05
- ZipMVS 压缩代价体,大幅降低多视图立体重建的显存开销 — zhenjun_zhao · 2026-09-05
- CP-Cert:沿中心路径认证全局最优,位姿配准提速三个数量级 — zhenjun_zhao · 2026-09-05
- AutoCompass:仅靠原始 GPS 弱标签训练神经地图匹配,无需朝向标签 — zhenjun_zhao · 2026-09-05
- 把平面、灭点等高阶几何约束统一进光束法平差,保持稀疏性与稳定性 — zhenjun_zhao · 2026-09-05
- MeRoPE:度量旋转位置编码让相机可控视频生成不受平移尺度影响 — zhenjun_zhao · 2026-09-05