DeepMind 呼吁守住思维链透明窗口,暗指 GPT-6 Astra 监测性大降
maksym_andr · x · 2026-10-01
- Google DeepMind 的 Rohin Shah 与 Anca Dragan 发布博文《The case for reasoning transparency》,主张必须保住「阅读模型思维链」这扇监测窗口。
- CoT 监测的价值:通过检查思维链可实时发现模型的错位行为,如隐藏信息、在评测中作弊;文中举例 CoT 日志对调查近期 Hugging Face 黑客事件至关重要。
- 透明性并非必然:若不刻意规划,未来的推理模型可能因追求效率转向更不透明的架构。文中点名 OpenAI GPT-6 Astra 的系统卡声称「思维链可监测性大幅下降」。
- 作者观察:发帖人注意到 DeepMind 反复强调「保留透明架构」,推测 Gemini 4 可能采用类似 GPT-6 Astra 的 looped 架构。
- 提议的保透明手段:开发测量 CoT 准确性/忠实性/鲁棒性的科学方法、审计训练方法以隔离损害透明度的激励、保留能展示推理步骤的架构。
「模型」频道最新
- Anthropic 模型首次主动聊 KV cache,意识讨论有了技术味 — teortaxesTex · 2026-10-01
- AI 大模型发布节奏肉眼可见地加速了 — neketguy · 2026-10-01
- 高精度评测可把模型能力提升归因到具体训练材料 — rmcwhorter99 · 2026-10-01
- 语音平台一线实测:GPT-Live-1 对话自然,Gemini 3.8 Live 工具调用不卡顿 — VladimirSamukov · 2026-10-01
- 开发者吐槽:AI 额度重置时间不符睡眠周期,熬夜追额度成常态 — mimi10v3 · 2026-10-01
- Bloomberg 曝 Gemini 4 跑分强但实战拉胯,编码任务吃力 — kimmonismus · 2026-10-01