Pearmut:让翻译人工评测像自动评测一样容易跑的开源平台
zouharvi · x · 2026-09-14
arXiv 论文《Pearmut: Human Evaluation of Translation Made Trivial》介绍轻量级人工评测平台 Pearmut:端到端 human evaluation 像自动评测一样容易搭建,消除传统工具(如 Appraise)繁重的工程与运维门槛。支持 DA、ESA、MQM 等标准协议并可扩展,具备文档级上下文、绝对与对比评估、注意力检查、ESAAI 预标注、静态与动态分配策略。目标是让可靠的人工评测成为模型开发与诊断的日常环节,而非偶尔为之的工程。已被 EMNLP 2026 Demo 接收,主要替代 WMT 的 Appraise。
所属事件:Pearmut翻译评测平台及cESA协议将亮相EMNLP(3 条相关)→
「编程与Agent」频道最新
- 调研 60+ 生成者后发现:AI 图像库的真痛点是检索而非收藏 — shivam_dewan · 2026-09-14
- LeanDB:用Lean类型系统为SQL数据库加上形式化验证前端 — hargup13 · 2026-09-14
- dotey 分享 iOS AI 开发流:AppKit+Figma 导入+Opus 还原度最高 — dotey · 2026-09-14
- Reddit 开发者求思路:让 Agent 自动定位线上故障并提交修复 MR — cruelcaricature · 2026-09-14
- Redpen 发布:验证编码 Agent 「说完成」时是否真的完成 — Scobleizer · 2026-09-14
- 开源 Infinite Bookshelf:一行提示词几秒生成整本书 — Roger_M_Taylor · 2026-09-14