机器翻译人工评测新工具:cESA 与 Pearmut 亮相 EMNLP

围绕机器翻译人工评测,Zouhar 的三项成果将在布达佩斯 EMNLP 多个场合展示。cESA(对比错误区间标注)协议让标注者同时查看多个模型译文,以错误区间加绝对打分方式评判,比逐条标注更快更客观,已用于 WMT26 评测;开源平台 Pearmut 则提供端到端的轻量可复现人工标注流程,将取代 WMT 此前使用的 Appraise,使人工评测像自动评测一样易于运行。

2026-09-14 ~ 2026-09-14 · 4 条相关