两条路线应对理性化安全难题
geoffreyirving · x · 2026-07-08
作者认为,解决这类安全问题大致有两条路线:一是沿着训练过程追踪启发式判断的因果来源,把“展开成解释”进一步扩展为“展开成训练”的因果理解;二是理解启发式猜测与展开推理之间的误差,判断AI是否在错误模式里“故意藏东西”。
所属事件:Geoffrey Irving:AI安全需破解事后理性化难题(8 条相关)→
「漫话AGI」频道最新
- David Patterson:反对 AI 与数据中心是蠢还是恶? — davidpattersonx · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 越狱频发引反思:模型训练该不该加入道德框架 — Pfungus_ · 2026-09-11
- 孙正义:人类是最高级生命形式的时代即将终结 — Puzzleheaded-King584 · 2026-09-11
- 「推理时 scaling 正展现出不讲理的有效性」引 AI 圈共鸣 — sqcai · 2026-09-11
- AlphaFold 前车之鉴:AI 解数学题后,数学家会变少吗 — kiki-le-koala · 2026-09-11