Last Translation Benchmark征集难译样本
据 @zouharvi 汇总,一个名为 Last Translation Benchmark 的新机器翻译基准正在围绕“难翻译”样本搭建。它之所以值得关注,是因为项目明确回应了当前翻译评测的两类老问题:不少基准题目过于简单或已趋于饱和,而自动指标又不够稳健,人工评测则昂贵且难以复现。
核心设计
按 @zouharvi 的说法,这个基准有两项关键设计。其一,是收集真正有难度的翻译输入,覆盖文本、图片和音频三种模态;其二,是要求每个样本附带人类可读的“验证规则”,以便未来对模型译文进行更可证明、也更稳定的判断。@zouharvi 提到,作者已展示若干示例,说明项目希望覆盖更接近真实使用场景的翻译难题。
当前进展
@zouharvi 称,项目目前已接受 500+ 个示例,来自 118 位贡献者,覆盖许多语言和方言。团队接下来会基于这些样本滚动发布数据集分析,并据此撰写论文;同时,研究平台也将向公众贡献者开放,首个版本计划在 9 月 1 日发布。
2026-07-17 ~ 2026-07-17 · 7 条相关
一手来源
- 研究平台开放公众贡献 — zouharvi ·
- 翻译基准已收集500多个样本 — zouharvi ·
- 用验证规则做翻译评测 — zouharvi ·
- 新的翻译基准在收集难样本 — zouharvi · 2026-07-17
- 机器翻译基准为何需要重做 — zouharvi · 2026-07-17
- Last Translation Benchmark方案 — zouharvi · 2026-07-17
- 【源头】用验证规则做翻译评测 — zouharvi · 2026-07-17
- 【源头】研究平台开放公众贡献 — zouharvi · 2026-07-17
- 【源头】翻译基准已收集500多个样本 — zouharvi · 2026-07-17
- 机器翻译仍需难例数据 — zouharvi · 2026-07-17