TII 发布 Falcon-Emirati-7B:靠 3 类数据让大模型学会方言

lmoroney · x · 2026-10-07

Laurence Moroney 分析 TII 新发布的 Falcon-Emirati-7B,回答「更大的多语模型能否自然学会方言」——答案是否定的,方言保真需要专门的数据工作。该模型基于 Falcon-H1-Arabic(每层并行运行 Mamba 状态空间层与注意力),再用三类数据继续训练:本地网站和论坛爬取的阿联酋方言文本、关于阿联酋文化的现代标准阿拉伯语写作、以及用词汇表和风格规则约束的合成方言数据。在由母语者收集的 1173 题基准 Alyah 上得 84.83%;更醒目的是 LLM 评审打分的开放式回答方言保真度:0.52,而对比的四个模型都在 0.05 以下——它们知道答案,却用标准阿拉伯语作答。作者指出这是 TII 自家评测,并认为该案例对任何想把模型适配到方言或小众领域的人都有参考价值。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →