Astra 系统卡:CoT 可控性随 RL 提升,更强结果用更少 token

SeunghyunSEO7 · x · 2026-09-04

作者阅读 Astra 系统卡的 CoT 可控性章节后指出:与以往模型不同,这次的 CoT 可控性随 RL 训练加长而改善,新模型还具备 no-CoT 能力,并以少得多的 token 取得更强成绩。作者打趣:这或许也让其他实验室的「非法蒸馏」更难了。

所属事件:GPT-6 Astra 系统卡:可控自身思维链达 60.9%,监控或失效(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →