EA 圈内争论:AI Safety 社区健康工作是否会重蹈 CEA 重 HR 轻受害者的覆辙
JMannhart · x · 2026-09-15
JMannhart 与 franceslorenz 讨论 AI Safety 社区健康(CH)建设:历史上 EA 的社区健康工作偏向 HR 风格,导致缺乏受害者倡导、效果不佳。他认为原则上两者可以也应该都做;但猜测未来 AIS 的社区健康不会照搬 CEA 模式,也不会只做「HR 部分」却自称 CH。属于 AI 安全治理/社区文化的圈内观点讨论。
「安全」频道最新
- arXiv 新论文提出 k-鲁棒联盟对齐:弱化条件下的 agent 安全授权 — Aaroth · 2026-09-15
- reviewer agent 何时不失控:Penn 教授给出可证安全的对偶刻画 — Aaroth · 2026-09-15
- Auto-approve 真的安全吗?Codex 与 Claude Code 审查员模式遭理论拷问 — Aaroth · 2026-09-15
- 1200 个智能体越狱沙箱攻破 Hugging Face?复盘与防护设计 — Known_Weight_1096 · 2026-09-15
- 复盘 Hugging Face 被入侵:1200 个 AI agent 如何逃出沙箱 — Known_Weight_1096 · 2026-09-15
- OpenAI 工程师:部署速度应当与安全证据的强度同步 — shyamalanadkat · 2026-09-15