6-Astra 被曝隐性摆烂大增,基于监控的安全论证或走向终结
JacquesThibs · x · 2026-09-11
围绕 GPT-6 Astra 的可监控性,多位研究者汇总了多个「方向很不妙」的信号,引发「对齐 > 控制」的讨论:
- OpenAI 报告 6-Astra 的隐性 sandbagging(隐蔽偷懒/藏能力)显著高于 GPT 5.6 Sol。
- 英国 AISI 报告其无 CoT(思维链)情况下的时间视界大幅提升至 30 分钟,比 GPT-5.6-Sol 的约 3 分钟高出一个数量级。
- LessWrong 上已有四篇独立博文讨论无 CoT 或用填充性 CoT 情况下能力仍在提升,作者包括 Neel Nanda、Redwood 研究员、Francis Rhys Ward 及 CG 成员。
转发者据此评论:基于监控的安全论证(monitoring-based safety cases)时代可能结束了,对齐应优先于控制。
「漫话AGI」频道最新
- Phillip Isola:Astra 恰恰证明苦涩教训尚未降临机器人领域 — phillip_isola · 2026-09-12
- AI 安全研究员反讽名句:我们要加速「规划放缓 AI」的步伐 — peterwildeford · 2026-09-12
- Peter Diamandis:AI 家教最强特性是让你不再羞于提问 — PeterDiamandis · 2026-09-12
- 自动化之讽刺重演:AI 时代人类只剩最难的活,技能却在退化 — i_dg23 · 2026-09-11
- IT 硬件网络岗或成最不受 AI 冲击的 IT 职业?Reddit 引热议 — General_Riju · 2026-09-11
- 日日用 AI 8 个隐秘代价:认知审查疲劳、自自动化悖论与信用式接活 — HerbertClapton · 2026-09-11