Cohere 发布 Tiny Aya L2-Thinker:3.35B 模型 60 种语言内推理率超 93%
Cohere_Labs · x · 2026-09-16
Cohere 团队发布论文与模型 Tiny Aya L2-Thinker,聚焦 L2 推理——模型能以用户提问的语言直接推理作答,而非一律切换到英文。
核心成果
- 3.35B 参数、32K 上下文,支持 45 种语言训练,在 6 个基准(数学、常识、开放生成、文化推理、指令遵循等)60 种语言上实现超过 90%(论文摘要称 93%)的语言内推理率,且性能保持强劲
- 在数据稀缺语言上,语言内推理率与任务准确率超过体积 2-7 倍的模型
方法:以数据为中心的混合策略
- SFT 数据由多语言推理数据、多语言非推理数据、英文推理数据三者组合
- 泛化到未见语言的关键:更广的语言覆盖 + 易得的多语言非推理数据 + 足够的英文推理底子
结论与开源:推理是一种语言无关的能力,通过精细的数据混合即可跨语言迁移,无需为每个目标语言准备推理监督数据。团队开源了模型权重与覆盖 44 种非英语语言的多语言推理数据,号称是已知覆盖面最大的多语言推理数据集。
「研究」频道最新
- Periodic Labs 用 1300 块 H200 训出 Neon,材料分析超 GPT-6 Astra — LiamFedus · 2026-09-16
- AI2 提出 NGU 采样法:把 RL 算力重新分配给 LLM 难题 — allenai · 2026-09-16
- CoLLAs 2026 口头报告:遗忘、睡眠重放与 LLM 工作记忆四篇 — apsarathchandar · 2026-09-16
- Jev 评测基准发布:十亿输入 token 仅 42 美元 — cephaloform · 2026-09-16
- 多智能体 RL 后训练破解 LLM 模式坍缩,提升回答多样性 — natashajaques · 2026-09-16
- 观点:世界模型到不了 AGI,持续学习才是最后也是最难的一块拼图 — Intelligent-Cream-14 · 2026-09-16