应否停发可监控性差的模型?Squee451:这明显在放大风险
Squee451 · x · 2026-09-05
Squee451 在同一串讨论中明确立场:完全赞同应当停止发布可监控性更差的模型,哪怕它们看起来更对齐,因为这种做法正在大幅推高风险。他推测,如果 Anthropic 和所有公司都同意这样做,OpenAI 也会跟进——但他承认这个想法可能过于乐观。
所属事件:CoT 可监控性下降引安全激辩:对齐与监控如何取舍(15 条相关)→
「漫话AGI」频道最新
- 与 ChatGPT 聊完两本书写作计划后,他觉得写不写都不重要了 — tinyfool · 2026-09-11
- 独立开发者观点:AI 让一人包办产品全流程成为可能 — alexmacgregor__ · 2026-09-11
- AI 安全从业者反思:廉价恐吓让公众把 AI 风险等同于灭绝风险 — Dr_Atoosa · 2026-09-11
- 博主悬赏页9年来首次被bot用AI文本蹲赏金 — gleech · 2026-09-11
- Mozilla CTO 呼吁校园暂停生成式 AI:恐失去一代儿童 — Dan_Jeffries1 · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11