TinyAya v0.3 开源语音翻译模型引入文本监督与 36 层 LoRA
irombie · x · 2026-07-23
TinyAya v0.3 是一个开放的 土耳其语↔印地语语音到语音翻译模型,基于 Cohere2 backbone + LoRA,并接了一个 冻结的 Moshi depth decoder 来生成语音 token。
这条线程的重点不只是“模型做出来了”,而是把训练过程的关键工程细节讲得很完整:
- 语料里包含 840,426 × 2 级别的词级对齐。
- 项目从 audio-only 转成了 text + audio 多任务,这是它历史上第一次引入监督文本。
- 在 5K steps 的配方复验里,最后是 36 层全加 LoRA adapter 的方案最好;作者认为顶部层的 adapter 是文本侧最关键的杠杆。
- 训练前加了 pipeline validation gate,结果真的抓到一个评测 harness 的 off-by-one bug。
- 为了让 layer-scan 训练在 v6e-8 切片上跑通,还修了 9 个 XLA blockers。
作者还表示 recipes、configs、W&B runs 和完整复盘都开源。
「研究」频道最新
- Google 研究探索用 AI agent 修正量子漂移 — mhdfaran · 2026-07-23
- RoboMME 用 16 个任务评测机器人长时记忆 — micoolcho · 2026-07-23
- NeuroAI 综述:视觉研究远领先于语言方向 — mtoneva1 · 2026-07-23
- Mila 将讨论非洲语言 AI 基准到底测什么 — hugo_larochelle · 2026-07-23
- 一张 Agent 技术栈图:生产级 AI 90% 靠系统架构 — theomitsa · 2026-07-23
- MIT 免费 SLAM 教程把机器人导航讲成实战入门 — lukas_m_ziegler · 2026-07-23