Rob Miles 讲解 AI 内部不可读的神经语

Computerphile 与 AI 安全研究者 Rob Miles 合作探讨「Neuralese」——LLM 内部不可解释的神经网络原生表征。视频指出,当前 Chain of Thought 让人类得以一窥模型的解题过程,但模型可能形成人类无法直接阅读的内部语言,这关系到可解释性研究的意义,也带来 AI 安全与监管方面的隐忧。

2026-09-10 ~ 2026-09-11 · 2 条相关