小红书联合高校发布CULTURE-MT:最强模型社媒翻译及格率不足40%
小红书技术REDtech · wechat · 2026-08-07
小红书联合浙江大学、复旦大学提出了首个面向中英社媒笔记翻译的评测基准 CULTURE-MT,旨在解决传统机器翻译难以传递文化意图与情感共鸣的问题。
- 评估标准与工具:团队首次提出「文化有效性」评估标准,并训练了基于 Qwen3-32B 的自动评估模型 JUDGER(准确率 86%),以替代对文化差异「失明」的传统指标(如 BLEU)。
- 模型评测发现:对 15 个主流模型的测试表明,即便是最强的闭源模型,其完美文化有效翻译的比例也仅在 38% 左右。同时,通过专门的「文化有效性引导」微调,8B 参数的小模型能将满分翻译比例从 4% 提升至 28%,突破规模天花板。
- 开源与招募:该工作已被 ICML 2026 接收,评测集已开源。此外,小红书也在文中发布了多语言翻译算法工程师及大模型应用算法工程师的招聘信息。
「研究」频道最新
- 3D打印机械臂捡衣服:单卡3.5小时训练搞定 — mishig25 · 2026-08-07
- 研究:AI 助手过于“短视”,习惯直接给答案阻碍独立思考 — xuanalogue · 2026-08-07
- AI+物理混合框架:用AI预测优化气候模拟算力分配 — bravo_abad · 2026-08-07
- WeirdML v2 评测发布:任务扩至 19 项,成本与性能呈明显正相关 — yacineMTB · 2026-08-07
- 首发意第绪语大模型:高质量语料与多任务基准 — Yiddish-NLP · 2026-08-07
- CLSS 模型:将蛋白质序列与结构映射至同一 AI 空间 — bravo_abad · 2026-08-07