peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练

simonguozirui · x · 2026-09-22

peanoai 宣布在 TPU 上实现了全参数强化学习训练:包括 310B 规模的 MiMo-V2.6,以及多个在 1000+ TPU 上稳定训练 1000+ 步的运行。

技术要点:

展示了 TPU 生态在超大规模 RL 训练上可行的工程路径。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →