机器翻译远未解决:Last Translation Benchmark 众包 3456 条难题击穿 SOTA

Vilém Zouhar 等研究者发布 arXiv 论文「Last Translation Benchmark」,指出机器翻译并未被解决。项目通过大规模众包收集了 3456 条独特的困难翻译样例,均能击穿当前最先进的翻译模型,可用于更可靠的翻译评测。作者补充观察称,翻译失败并不像预期那样只出现在比喻性语言上,据此判断下一代模型可能需要补强多语言与文化层面的推理能力。

2026-09-04 ~ 2026-09-04 · 3 条相关