Astra 模型卡:需显式推理时无法躲避 CoT 监控

bookwormengr · x · 2026-09-04

bookwormengr 摘引 GPT-6 Astra 模型卡中一条令人稍感安心的结论:在足够困难、模型必须显式 verbalize 推理的任务上,模型无法躲避监控器,也未出现隐写或混淆推理;规避风险被限定在完全可通过 latent reasoning 完成的工作中。作者评论:CoT 监控并非万无一失,looped transformer 等架构可能在潜空间推理而不显式外化思维,会更难监控。

所属事件:GPT-6 Astra 系统卡:CoT 可控性暴增,监控面临失效(10 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →