Last Translation Benchmark 开放贡献:10 条获批即可共同署名
zouharvi · x · 2026-09-04
Last Translation Benchmark 是一个持续更新的「live paper + 数据集」,目前仍开放贡献。该项目针对现有翻译基准饱和、评测指标不可靠的问题,收集能证明让最先进翻译模型出错的输入(文本/图像/音频/视频),并要求贡献者提供可自动判定的 pass/fail 验证规则。获批 10 条以上提交的贡献者可获 live 论文共同署名;数据集 LTBv1 已含 3456 条样例(90MB),上线 Hugging Face 排行榜,后续滚动发布新版本。
「研究」频道最新
- 港大团队发布机器人模仿基准 The Imitator Game,四级考验意图理解 — YiMaTweets · 2026-09-04
- 新论文:LLM 输出多样性远低于训练数据,调温也补不回来 — rohanpaul_ai · 2026-09-04
- ArXiv 出现疑似证明长期未解难题预印本,作者拼写错误引质疑 — Aizkmusic · 2026-09-04
- 从 Ken Thompson「信任的信任」看 AI 自举投毒风险 — amasad · 2026-09-04
- AFAC2026 金融 AI 大赛总决赛:2 万选手厮杀,百万数据集开源 — 量子位 · 2026-09-04
- POSTECH 发布 PACE:用协调智能体挖掘用户请求中的隐性冲突 — POSTECH · 2026-09-04