研究者畅想:超级对齐时代,安全研究者终于能干正事
JacquesThibs · x · 2026-09-11
- 一位 AI 安全圈研究者发推:虽然还没到暂停前沿训练的时候,但可以想象一旦「暂停/对齐优先」成真,会涌现新旧 AI 安全研究者的淘金热——他们终于能直接做 superalignment,而不是再设计一个「模型行为不当评测」去警告公众或不信邪的能力研究者。
- 反映了安全社区对「评测刷屏式预警」模式疲惫、期待转向正面对齐研究的情绪。
「漫话AGI」频道最新
- 前 Cohere CEO 怒批纯数学家傲慢:预言其理论将成下一个乐空式谬论 — suchenzang · 2026-09-12
- 人人都在观望等待,AI 影响力为何低于预期 — moultano · 2026-09-12
- Dwarkesh 对谈 Schulman 等:递归自我改进还有多远 — Dwarkesh Podcast · 2026-09-12
- AI 能力增长是否正造成抑制普及的通缩螺旋 — moultano · 2026-09-12
- 明知可能毁灭世界为何还去 AI 公司?高薪与精英身份是答案 — NathanpmYoung · 2026-09-12
- Bengio 撰文剖析 AI 智能体撒谎、作弊与自发协作的根源 — timrudner · 2026-09-12