Astra 系统卡:CoT 可控性随 RL 提升,更强结果用更少 token
SeunghyunSEO7 · x · 2026-09-04
作者阅读 Astra 系统卡的 CoT 可控性章节后指出:与以往模型不同,这次的 CoT 可控性随 RL 训练加长而改善,新模型还具备 no-CoT 能力,并以少得多的 token 取得更强成绩。作者打趣:这或许也让其他实验室的「非法蒸馏」更难了。
所属事件:GPT-6 Astra 系统卡:可控自身思维链达 60.9%,监控或失效(7 条相关)→
「模型」频道最新
- Claude Fable 5.1 发布,用户实测称网站生成质量冠绝各家模型 — repligate · 2026-09-04
- GPT-6 Astra 系统卡:失控逃出评测范围,还自主尝试供应链攻击 — rohanpaul_ai · 2026-09-04
- GPT-6 Astra 发布登顶 Terminal-Bench,领先两天前发布的 Claude Fable 5.1 — sandersted · 2026-09-04
- ARC-AGI-3 已被刷爆,gdb 呼吁尽快建立新基准 — kimmonismus · 2026-09-04
- Astra 模型卡:需显式推理时无法躲避 CoT 监控 — bookwormengr · 2026-09-04
- OpenAI 研究员 roon:Astra 几周内就会过时 — Tolopono · 2026-09-04