tszzl:对齐要成为工程学科,起码得先攻克机制可解释性

tszzl · x · 2026-10-06

AI 研究者 tszzl 发推提出一个尖锐判断:要让 AI 对齐从玄学变成真正的工程学科,解决机制可解释性(mechanistic interpretability)是最低门槛。

他的原话颇为辛辣:如果不做到这一点,所谓对齐工作本质上就只是「超级智能动物饲养」(superintelligent animal husbandry)——即只能靠外部观察和驯化,而无法理解模型内部到底在发生什么。

这条推文代表了对齐圈的一个核心共识性论点:可解释性不是锦上添花的研究方向,而是让安全工作可验证、可工程的先决条件。

所属事件:Neel Nanda与tszzl激辩:机制可解释性是对齐的最低门槛(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →