TRL 发布百万 token 长上下文训练实战指南

Hugging Face 在 TRL(GitHub 19.3k star)的 What's New 与文档中新增「Training Beyond 1M Tokens」实战指南。指南指出 agent 长会话会累积数十万 token,前沿模型上下文可能不足,并演示在单节点 8 卡环境上完成 100 万 token 序列的训练,成功训通 Qwen3-8B 等模型。

2026-09-10 ~ 2026-09-10 · 2 条相关