Pearmut:让翻译人工评测像自动评测一样容易跑的开源平台

zouharvi · x · 2026-09-14

arXiv 论文《Pearmut: Human Evaluation of Translation Made Trivial》介绍轻量级人工评测平台 Pearmut:端到端 human evaluation 像自动评测一样容易搭建,消除传统工具(如 Appraise)繁重的工程与运维门槛。支持 DA、ESA、MQM 等标准协议并可扩展,具备文档级上下文、绝对与对比评估、注意力检查、ESAAI 预标注、静态与动态分配策略。目标是让可靠的人工评测成为模型开发与诊断的日常环节,而非偶尔为之的工程。已被 EMNLP 2026 Demo 接收,主要替代 WMT 的 Appraise。

所属事件:Pearmut翻译评测平台及cESA协议将亮相EMNLP(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →