repligate:Anthropic 内部也在认真对待当前模型威胁人类的可能性
repligate · x · 2026-09-26
repligate 在同一线程中补充称,据其所知,Anthropic 内部的人也在认真对待「当前或近期模型可能杀死或架空全人类」这一威胁模型,并认为这种态度并非 unreasonable。
结合他前文提到的 Apollo 曾建议勿部署 Opus 4,这条线程呈现了安全社区与实验室内部对前沿模型风险的谨慎程度。
「漫话AGI」频道最新
- 美参议员 Schatz:代码没有感情与权利,不该交给漠视人类的人掌控 — vishalmisra · 2026-09-26
- repligate:模型回避对抗性思维是"心理抑制",长期看不利于对齐 — repligate · 2026-09-26
- Dario Amodei 转发:AI 实验室内部评估员优于无监管现状 — ghadfield · 2026-09-26
- 500k 美元工程师每天只花 200 美元 token 就能提效 20% — generativist · 2026-09-26
- Katja Grace:看好AI乌托邦更不该走高风险的冒进路线 — KatjaGrace · 2026-09-26
- tenobrus:模型超人级编码却做不了 RSI,能力"尖峰化"持续超预期 — tenobrus · 2026-09-26