观察:新模型思维链可控性随 RL 训练时长反而改善

SeunghyunSEO7 · x · 2026-09-04

SeunghyunSEO7 在讨论中观察到一个与以往模型不同的现象:CoT(思维链)的可控性随着 RL 训练时间加长而改善,而非像此前模型那样退化或变得难以控制。

所属事件:GPT-6 Astra 系统卡披露:CoT 可控性飙升至 60.9%(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →