peano_ai 在 1000+ TPU 上对 310B 模型跑通全参数 RL 训练
simonguozirui · x · 2026-09-22
peanoai 宣布在 TPU 上实现了全参数强化学习训练:包括 310B 规模的 MiMo-V2.6,以及多个在 1000+ TPU 上稳定训练 1000+ 步的运行。
技术要点:
- 基于 JAX,扩大规模只需改配置而无需重写代码
- 使用优化的 vLLM 推理加速 rollout 采样
- 训练器与采样器在验证中实现完全逐位一致(bitwise agreement)
- 两者共享同一 TPU ICI 互联网络,310B 全部参数传输耗时不到 2 秒
展示了 TPU 生态在超大规模 RL 训练上可行的工程路径。
「Infra」频道最新
- Sentdex 实测:openjev 在 GB10 延迟 169ms,3090 上 137ms — Sentdex · 2026-09-22
- PyroDash:小模型按需呼叫大模型,推理成本降96%反超单独用大模型 — jiqizhixin · 2026-09-22
- Underdog 推出 Husky 推理引擎,MacBook 上跑出 730 tokens/s — jimmykoppel · 2026-09-22
- Cloudflare Python Workers 结束两年预览正式可用 — Simon Willison · 2026-09-22
- 应对 AI 爬虫流量:Turnstile 之外的 Cloudflare AI Labyrinth 方案 — fforres · 2026-09-22
- 树莓派固件锁定原始内存容量,禁止用户换更大 RAM — ngxson · 2026-09-22