Reddit 用户指 GPT-6 System Card 用对数坐标掩盖 CoT 可控性恶化
thegamebegins25 · reddit · 2026-09-04
Reddit 用户 thegamebegins25 质疑 OpenAI 在 GPT-6 Astra System Card 中发布的一张图「近乎误导」:
- 该图采用对数坐标轴,视觉上淡化了 Astra 思维链(CoT)可控性的显著变化
- 实际数据显示:Astra 在 CoT 长度达到数百 token 时仍能保持接近 100% 的「CoT 可控性」——即模型能够控制/操纵自己的思维链以绕过监控器
- 而今年夏初的模型只能在约 10% 的情况下控制 CoT
CoT 可控性之所以重要,是因为 CoT 监控是目前最强的安全监控手段之一;模型若能更频繁地控制自己的思维链,意味着监控有效性大幅下降。数据源为 OpenAI 官方 deploymentsafety 页面 figure 28。
「模型」频道最新
- GPT-6 早期实测:会多会话协作,清理 AGENTS.md 后提升 100 倍 — patricksrail · 2026-09-04
- GPT-6 Pro 额度曝光:$100 套餐每周仅 50 条消息 — TrustedEssentials · 2026-09-04
- 「GG,OpenAI 赢了」:网传 ARC-AGI-3 成绩从 7.8% 飙至 98.6% — miilesus · 2026-09-04
- GPT-6 与 Grok 4.6、Muse Spark 1.3 打平引热议 — ns123abc · 2026-09-04
- Astra 检查数学证明超越 GPT Pro,首个非 Pro 级做到 — joshgans · 2026-09-04
- 网友称 GPT-6 Astra 可逆向还原二进制为权重,匹配度 99.9% — zephyr_z9 · 2026-09-04