「最后的翻译基准」发布:多模态样本+人工验证规则击穿主流翻译模型
Vilém Zouhar · hf · 2026-09-04
- The Last Translation Benchmark 上线 Hugging Face,提供经同行评审的多模态样例,专门针对能够击穿主流翻译模型的难点场景。
- 配套手工制作的验证规则,使评测结果可靠且可操作,补足现有翻译评测的短板。
所属事件:「最后的翻译基准」上线,专攻主流翻译模型弱点(2 条相关)→
「研究」频道最新
- Geoffrey Irving:模型已强于散文与形式数学,概念对齐研究仍有机会 — geoffreyirving · 2026-09-04
- Resolution 成立新 Agent Foundations 团队,延续 MIRI 理论对齐研究 — geoffreyirving · 2026-09-04
- 新研究检验多语言 LLM:跨语言句法相似结构是否共享处理机制 — EliasEskin · 2026-09-04
- 跑一亿次 Boltz-2 共折叠,探索虚拟细胞的自底向上路径 — HannesStaerk · 2026-09-04
- SWE Refactor Bench 发布:C 转 Rust 全仓库迁移,Claude 验证器拦截过半提交 — jiqizhixin · 2026-09-04
- OBLIQ 提出更有雄心的搜索基准,展望 2030 信息检索 — CShorten30 · 2026-09-04