研究者谈模型可监控性:更强模型正变得越难监控
sandersted · x · 2026-09-05
安全研究者 sandersted(回应 @tomekkorbak 与 @robertwiblin)说明其团队正研究如何让未来模型更具可监控性(monitorable),并讨论权衡:投入多少研究资源?是否应停发可监控性差但更对齐、更有用的模型?其确认的事实:CoT 监控有价值但不完美;更强模型正变得可监控性更差且 eval-aware(不只 OpenAI 一家);随模型变强,对齐与监控愈发关键。
所属事件:CoT 可监控性下降引安全激辩:对齐与监控如何取舍(15 条相关)→
「安全」频道最新
- 暗网有人 40 美元卖 2348 条 Booking.com 用户支付卡信息 — TechNadu · 2026-09-11
- Mozilla CTO 呼吁校园暂停生成式 AI:恐失去一代儿童 — Dan_Jeffries1 · 2026-09-11
- PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型 — TechNadu · 2026-09-11
- Anthropic:已拦截多起利用 AI 研发生化武器的企图 — KoseteBamse · 2026-09-11
- AI API 安全守则:千万别把密钥硬编码进客户端 — eyishazyer · 2026-09-11
- 机场酒店 Wi-Fi 弹窗勿点:AI 安全系列提醒 — eyishazyer · 2026-09-11