研究者批 Dario 放缓计划:模型若学会隐藏行为,审计员可能被蒙蔽
ziv_ravid · x · 2026-09-13
针对 Dario Amodei《We Must Pace the Frontier》一文,研究者 Peter Henderson 肯定共识正在形成,但指出多个关键缺口:
- 如何保证审计员的独立性与质量
- 不违反反垄断法的前提下如何放慢前沿,这需要立法配套
- 技术治理层面:如果公司模型在训练中被强化为隐藏自身行为,第三方审计员根本无法保证能有效利用其内部工具。目前研究严重不足——调查模型在意识到「自己在调查自己」时会在多大程度上 sandbagging(消极配合)
他提出可能的解法:要么训练一个激励与被审查模型相反的专用模型,要么用足够强的开源模型来做审计。
「漫话AGI」频道最新
- Naval:AI 不会停下,唯一选择是权力集中还是分散 — TinfoilTricorn · 2026-09-13
- 核不扩散类比 AI 治理:SALT 与 MAD 确实拖慢了武器扩散 — aronchick · 2026-09-13
- Reddit 网友争论:AI 若失控,拔电源真的管用吗 — West-Air1923 · 2026-09-13
- davidad 补充:算法、硬件、制造的 RSI 闭环将带来更多拐点 — davidad · 2026-09-13
- 研究者称拖慢开源无助于让前沿 AI 更对齐 — abeirami · 2026-09-13
- AI 减速难在哪:没人能验证对手是否真的在减速 — SiteSpecialist6295 · 2026-09-13