对齐 vs 可监控之争:sandersted 称更想要对齐的而非可监控的模型
sandersted · x · 2026-09-05
一场关于「可监控性(monitorability)与对齐(alignment)权衡」的 X 讨论中,sandersted 回应称:如果只能二选一,他宁愿要一个对齐的模型而非一个可监控的模型,但真正需要的是通过监控获得对齐更高置信度;他认为核心分歧点在于「通用监控在多大程度上依赖 CoT 监控」。此前 @Squee451 提出应停止发布可监控性更差(即使看起来更对齐、更有用)的模型,认为这明显在大幅抬高风险,并寄望各公司能就此达成一致。
所属事件:CoT 可监控性下降引安全激辩:对齐与监控如何取舍(15 条相关)→
「漫话AGI」频道最新
- 与 ChatGPT 聊完两本书写作计划后,他觉得写不写都不重要了 — tinyfool · 2026-09-11
- 独立开发者观点:AI 让一人包办产品全流程成为可能 — alexmacgregor__ · 2026-09-11
- AI 安全从业者反思:廉价恐吓让公众把 AI 风险等同于灭绝风险 — Dr_Atoosa · 2026-09-11
- 博主悬赏页9年来首次被bot用AI文本蹲赏金 — gleech · 2026-09-11
- Mozilla CTO 呼吁校园暂停生成式 AI:恐失去一代儿童 — Dan_Jeffries1 · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11