一篇经典监督论文,被拿来影射 AI 的递归监督问题
sebkrier · x · 2026-07-26
这条帖子贴出一篇经典论文 《But Who Will Monitor the Monitor?》,并把它包装成 AI 安全/治理里迟早会被“重新发明”的思路:递归监督和验证器落地问题。
论文讨论的是:当系统里需要一个“监工”去发现偏差时,谁来监督监工?作者提出一种合约设计,让监工本身对监控技术负责,从而即使监工的观测是私有且有成本的,激励机制依然能成立。
论文还进一步分析了:在什么条件下,这类合约能真正让监工有动力好好工作,并把结果与虚拟执行、重复博弈理论联系起来。
「漫话AGI」频道最新
- 持续学习可能不会高调发布,而是从纠错沉淀成规则开始 — VraserX · 2026-07-26
- 深度反思:沉迷 Claude 背后的成瘾与权力让渡 — round · 2026-07-26
- 一句 AI 讽刺梗,把“这从未发生”说成不再雇人 — taherdhanera · 2026-07-26
- 科技圈的天网式恐惧叙事,更多是在做姿态 — tekbog · 2026-07-26
- AI 自主做出突破后,开发者该拿多少功劳? — Turbulent-Step-3207 · 2026-07-26
- Mollick 指出,开源权重公开信掩盖了签署者的分歧 — emollick · 2026-07-26