众包 3456 条难题击穿 SOTA 翻译模型,Last Translation Benchmark 发布
zouharvi · x · 2026-09-04
Last Translation Benchmark 论文正式发布:通过大规模众包收集了 3456 条独特的困难翻译样例,均能击穿当前最先进的翻译模型,可用于更可靠的翻译评测。论文指出主流翻译基准已饱和、评测指标不可靠或难以扩展,因此转向「能证明让模型出错」的样例集,覆盖文本、图像、音频、视频多模态输入。
- 数据集 LTBv1 共 3456 条样例(90MB),已上线 arXiv 与 Hugging Face 排行榜
- 持续开放贡献:提交可验证的困难样例并给出自动 pass/fail 规则,获批 10 条以上可成为 live paper 共同作者
- 项目持续滚动更新数据集与论文版本,代码托管在 GitHub
所属事件:机器翻译远未解决:Last Translation Benchmark 众包 3456 条难题击穿 SOTA(3 条相关)→
「研究」频道最新
- 港大团队发布机器人模仿基准 The Imitator Game,四级考验意图理解 — YiMaTweets · 2026-09-04
- 新论文:LLM 输出多样性远低于训练数据,调温也补不回来 — rohanpaul_ai · 2026-09-04
- ArXiv 出现疑似证明长期未解难题预印本,作者拼写错误引质疑 — Aizkmusic · 2026-09-04
- 从 Ken Thompson「信任的信任」看 AI 自举投毒风险 — amasad · 2026-09-04
- AFAC2026 金融 AI 大赛总决赛:2 万选手厮杀,百万数据集开源 — 量子位 · 2026-09-04
- POSTECH 发布 PACE:用协调智能体挖掘用户请求中的隐性冲突 — POSTECH · 2026-09-04