训练数据就是语言的「军队」:嘈杂翻译淹没母语文本致 LLM 失真
yoavgo · x · 2026-10-06
UrikaUri 在 COLM 2026 发布 MameLoshnLM 相关研究,借「语言是有军队的方言」这句意第绪谚语指出:多语言 LM 的训练数据就是那支军队。当母语文本被大量嘈杂翻译文本淹没时,模型看似流利,却丢失了该语言独有的特质。作者 yoavgo(Yoav Goldberg)转发。
「研究」频道最新
- 主动式 LLM Agent 提出设计框架,23 种配置揭示信任断层 — minnesotanlp · 2026-10-06
- SearchJev 搜索决策提速 5 倍,校准误差最高降 74% — Congfeng Cao · 2026-10-06
- AI 自动研究发现更快分子优化器,力计算最多省 60% — Artem Tsypin · 2026-10-06
- ID-Forcing 测试时框架,让短视频模型生成分钟级长视频 — SeoulNatlUniv · 2026-10-06
- 研究揭示用自生成文本做测试时训练会系统性损害模型 — KAUST · 2026-10-06
- 300M 模型只学「非语言先验」,在上下文中学会学会语言 — Lennart Carstens-Behrens · 2026-10-06