Rob Leclerc:模型不可监控是实验室的选择,而非能力增长的必然

robleclerc · x · 2026-09-18

Rob Leclerc 回应关于模型越来越难以监控的讨论。他主张:当训练目标偏重“形式”(form)而非“功能”(function)时,等于放松了对模型可读性(legibility)的约束,出现不可监控性是意料之中。但这是可以权衡的设计选择:如果加入可读性约束,可以换取更高的可读性,代价是牺牲模型性能。

他认为危险之处在于暗示“模型越强就必然越不可监控”——这并非技术宿命,而是完全掌握在实验室手中的取舍。这番话是针对 @theo 抱怨“模型正变得无法监控”的回应,把问题从悲观预言拉回到实验室的责任与选择上。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →