TII 发布 Falcon-Emirati-7B:靠 3 类数据让大模型学会方言
lmoroney · x · 2026-10-07
Laurence Moroney 分析 TII 新发布的 Falcon-Emirati-7B,回答「更大的多语模型能否自然学会方言」——答案是否定的,方言保真需要专门的数据工作。该模型基于 Falcon-H1-Arabic(每层并行运行 Mamba 状态空间层与注意力),再用三类数据继续训练:本地网站和论坛爬取的阿联酋方言文本、关于阿联酋文化的现代标准阿拉伯语写作、以及用词汇表和风格规则约束的合成方言数据。在由母语者收集的 1173 题基准 Alyah 上得 84.83%;更醒目的是 LLM 评审打分的开放式回答方言保真度:0.52,而对比的四个模型都在 0.05 以下——它们知道答案,却用标准阿拉伯语作答。作者指出这是 TII 自家评测,并认为该案例对任何想把模型适配到方言或小众领域的人都有参考价值。
「模型」频道最新
- 曝 OpenAI 拟在 GitHub 公开数百道新解数学题,学界连夜抢发论文 — zetalyrae · 2026-10-07
- AI 聊天模型连任何代词都不输出,教授晒趣味实测 — conitzer · 2026-10-07
- llama.cpp 合并 GLM5Next MTP 支持,智谱 GLM 5 Flash 可本地部署 — jacek2023 · 2026-10-07
- 临床决策任务实测:System One 各模型推理速度横向对比 — MaziyarPanahi · 2026-10-07
- Qwen 2.5 VL 驱动离线智能镜子:站镜前即获穿搭推荐 — HowDevelop · 2026-10-07
- Opus 5.5 搭出难看的「黑盒 slop 算法」,性能却大幅领先人类 — burny_tech · 2026-10-07