训练数据就是语言的「军队」:嘈杂翻译淹没母语文本致 LLM 失真

yoavgo · x · 2026-10-06

UrikaUri 在 COLM 2026 发布 MameLoshnLM 相关研究,借「语言是有军队的方言」这句意第绪谚语指出:多语言 LM 的训练数据就是那支军队。当母语文本被大量嘈杂翻译文本淹没时,模型看似流利,却丢失了该语言独有的特质。作者 yoavgo(Yoav Goldberg)转发。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →