我们读不懂的 AI 语言:Rob Miles 讲解 Neuralese
mycall · reddit · 2026-09-11
科普频道与安全研究者 Rob Miles 合作制作视频,探讨「Neuralese」——模型内部不可解释的神经网络原生表征。视频讨论了可解释性研究的意义、模型可能形成人类无法直接阅读的内部语言带来的对齐与透明度挑战,以及当前解读模型内部状态的技术进展。
所属事件:Rob Miles 讲解 AI 内部不可读的神经语(2 条相关)→
「漫话AGI」频道最新
- Mathathon 主办方回应公开信:弃用黑客松模式,增设半年研究期 — _sathvikr · 2026-09-11
- Mitchell Hashimoto:想法不值钱,执行力才是分水岭 — MikeBirdTech · 2026-09-11
- OpenAI 递归自我改进研究员警告:3 年内人类灭绝概率 70% — intellectronica · 2026-09-11
- Ben Todd:AI 灭绝风险常见估计达 30%-70%,远超 10% 锚点 — ben_j_todd · 2026-09-11
- 前 Anthropic 研究员 Jacob Coxon 上 NBC:警惕 AI 递归自我改进失控信号 — rohanpaul_ai · 2026-09-11
- 马斯克放话:5 年内 AI 将超越全人类智慧 — JRIngallinera · 2026-09-11