可解释性开放难题:能否可信编辑模型的上下文信念

thebasepoint · x · 2026-09-27

在与研究者 Jack W. Lindsey 的讨论中,thebasepoint 举了一个可解释性领域「众多开放问题之一」:是否可能令人信服地编辑模型在上下文中对某个世界状态的信念,或对其当前目标的设定?

他指出这一点至关重要——如果想做严谨的因果实验,就需要这种干预能力,而这目前基本仍是开放问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →