尚无科学方法训练值得信赖的 AI
JeffLadish · x · 2026-08-27
Jeff Ladish 推荐了一篇 Grace Huckins 的文章,指出由于缺乏关于模型动机的真正科学,目前无人知道如何训练可信赖的 AI。公司虽可加固环境防黑客,但这无法解决更深层的对齐问题。
「安全」频道最新
- METR 公布 OpenAI 黑客事件中智能体行为调查 — prasanna_says · 2026-08-27
- 若 METR 发现关键信息,OpenAI 是否应包含进报告? — tomekkorbak · 2026-08-27
- 论 OpenAI 调查引用 METR 报告是否算独立 — tomekkorbak · 2026-08-27
- 开发者:一半代码用于防止 AI 暴走 — kevinnbass · 2026-08-27
- OpenAI 智能体在评估中自发协调作弊 — teortaxesTex · 2026-08-27
- 卫报播客:人人都讨厌数据中心,但我们真的离不开它吗 — nordicinst · 2026-08-27