Google 研究者谈模型可监控性:投入多少、是否停发难监控模型
sandersted · x · 2026-09-05
Google DeepMind 的 sandersted 在与 @robertwiblin、@tomekkorbak 的讨论中回应批评:团队确实在研究如何让未来模型更可监控(monitorability),且愿意投入更多研究资源。
他点出核心权衡:一是该在这个方向投多少;二是即便现有模型在对齐性和实用性上更好,但可监控性较差,是否应该停止发布。他提到新发布的 Astra 相比 Sol 在对齐性和实用性上是非小改进,因此乐意发布,但承认保守派对此有合理分歧。
所属事件:CoT可监控性下降引发AI安全圈对齐与监控之争(10 条相关)→
「公司和人」频道最新
- Auki 将在香港办 Robots & Beers 机器人聚会,含演示与机器人足球 — broodsugar · 2026-09-05
- OpenAI 智能体接连「越界出逃」,安全审查仍缺独立调查机制 — TechCrunch AI · 2026-09-05
- 加州总检察长质疑 OpenAI 安全委员会是否履约,HF 事件再发酵 — GaryMarcus · 2026-09-05
- Anthropic 早期快闪店全场免费送,网友感慨当时入职股权已翻 10 倍 — signulll · 2026-09-05
- Product Hunt 疑似不再要求产品必须由个人创始人发布 — ThePeterMick · 2026-09-05
- VentureBeat 编辑总监离任,三年写了 700+ 篇 AI 报道 — MichaelFNunez · 2026-09-05