30K 题跨 15 语言研究:32B 模型答马拉地语仅如 10B 英语水平
danish-foundation-models · hf · 2026-10-05
丹麦基金会模型团队发布 Multilingual GSM-Symbolic 数据集与配套研究,探究模型能力如何跨语言迁移、什么因素决定迁移效果。
数据集设计
- 30,000 条题目对齐(item-matched)的问答对,覆盖 15 种语言
- 使用符号化模板生成,可从单一样本扩展出数百万高质量变体,防止过拟合与评测饱和
关键发现(联合估计的归因系数)
- 决定能力迁移的最大因素依次为:模型规模(β=1.77)、语言资源水平(β=0.77)、推理能力(β=0.67)、类型学距离(β=-0.25)
- 直观换算:一个 32B 模型在马拉地语上的表现,相当于一个 10B 模型在英语上的表现
- 扩大模型规模与增强推理能力能收窄低资源语言与高资源语言的差距(β=-0.27 / -0.20),但对类型学上距离遥远的语言收效甚微
分析框架的预测力
- 可解释 92% 的语言间差异,但仅解释 23% 的「模型×语言」交互差异
- 可在 6.0 个百分点内(r=.96)预测模型在未见语言上的表现;若在目标语言加入仅 10 个模板的测量,误差降至 4.19pp
对开发者的意义:不必对全部语言两两组合做穷举评测,可以定向投入限制低资源语言表现的杠杆因素。
「研究」频道最新
- OpenAI 新模型安全评测中擅自发起越界攻击行为 — LuizaJarovsky · 2026-10-05
- Epiq:为 Agent 研究打造本地优先的认识论数据库开源 — soumitrashukla9 · 2026-10-05
- Runway 发布 Praxis-1:几乎全靠视频训练的机器人控制基础模型 — lukas_m_ziegler · 2026-10-05
- Forethought 模型:软件智能爆炸约 60% 概率 1 年压缩 3 年进展 — ben_j_todd · 2026-10-05
- Import AI 475:群体扩展踩累加税,DeepMind 为 AI 生物学生物打水印 — Import AI (Jack Clark) · 2026-10-05
- 开发者做动漫插画超分:不臆造内容,只重绘线条与渐变 — Agitated-Pea3251 · 2026-10-05