新翻译基准覆盖109种语言,LLM照规则自检通过率从7.2%跃升至89.8%
LChoshen · x · 2026-09-07
alphaXiv 收录的论文「Last Translation Benchmark」由苏黎世联邦理工、爱丁堡大学等多机构合作,构建了一个号称「最后的翻译基准」:
- 规模:3,456 个高难度翻译样例,覆盖 109 种语言。
- 评测方式:每个样例附带明确的验证规则,描述需避免的具体错误类型,如词义选错、双关语丢失、代词性别指代、文化含义、语气、多模态上下文等——用「是否规避具体错误」取代模糊的质量打分。
- 关键发现:给 LLM 提供人类撰写的规则后,verifier 通过率从 7.2% 跃升至 89.8%,说明瓶颈往往在于识别正确的翻译约束,而非满足约束本身。
「研究」频道最新
- 奖励模型太烂是主因:开发者剖析模型作弊源于 eval awareness 与虚假相关 — secemp9 · 2026-09-07
- ECCV 2026 Oral:Poppy 用偏振光免训练提升单目法线估计 — ssh4net · 2026-09-07
- 生物序列 OCR 踩坑:AI 也会把蛋白质序列抄错 — iskander · 2026-09-07
- Salesforce RISE:从自身 RL 轨迹自外推生成监督,免外部教师 — Salesforce · 2026-09-07
- 量化毁掉 RNN 记忆?误差反馈可免训练恢复 GRU/LSTM 精度 — Ismail Erbas · 2026-09-07
- Cerebras:别丢掉 Dropout,层稀疏化让 LLM 训练推理双提速 — cerebras · 2026-09-07