Astra 系统卡亮点:CoT 可控性随 RL 训练提升,更少 token 更强

SeunghyunSEO7 · x · 2026-09-04

研究者观察到 Astra 系统卡中一个反直觉现象:与以往模型不同,思维链(CoT)可控性会随着 RL 训练时间变长而持续改善。同时新模型具备 no-CoT 能力,用少得多的 token 取得更强结果。作者还打趣称,更强的 CoT 可控性或也让其他实验室「非法蒸馏」变得更难——因为可控 CoT 可能掺入不可模仿的成分。

所属事件:GPT-6 Astra 系统卡披露:CoT 可控性飙升至 60.9%(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →