cESA协议:一次对照标注多个译文,更快更稳的机器翻译人工评测
zouharvi · x · 2026-09-14
arXiv 论文《Contrastive ESA: Human Evaluation of Multiple Translations at Once》提出 cESA(对比错误跨度标注)协议:标注者同时查看同一原文的多个译文,标出主/次错误跨度并给出 0–100% 的绝对分数。相比逐条单独评估,共享上下文让判断更一致、更省时。作者用 12 个模型的英日翻译大规模人工评测验证,cESA 显著降低标注时间与噪声;与已有的对比排序法不同,它产出绝对质量分,可直接做非参数模型排名,无需事后校正。该协议已在工具 Pearmut 中实现并用于 WMT26。
「研究」频道最新
- LeanDB:用Lean类型系统为SQL数据库加上形式化验证前端 — hargup13 · 2026-09-14
- 研究者激辩:AI 破解癌症若实证有效,arXiv 该不该拒收 — IanArawjo · 2026-09-14
- 把评测当老虎机:动态分配标注预算,优先评最优模型 — zouharvi · 2026-09-14
- WMT评测工具Pearmut取代Appraise,三项评测方法将亮相EMNLP — zouharvi · 2026-09-14
- Looped Flows 论文:扩散去噪+循环推理,ARC-AGI-1 达 58.8% — LucaAmb · 2026-09-14
- rankECE:用相邻排序比较替代分箱,更可靠地度量模型校准误差 — _onionesque · 2026-09-14