研究者激辩可解释性:NLA 能否揭示模型内部机制

9 月 27 日,AI 安全研究者 banburismus 与 thebasepoint 在多则帖子中就可解释性研究(interp)的价值展开交锋,焦点集中在 NLA(自然语言消融/自然语言抽象)对前沿安全到底有多大用处。

已确认

为什么重要

2026-09-27 ~ 2026-09-27 · 5 条相关

事件全程(共 2 集)→

一手来源