模型窃取论文作者承认原始定理有误,但可修正

ArthurConmy · x · 2026-08-04

作者承认自己在《Stealing Part of a Production Language Model》里证明过的一个原始结论写错了,但这个错误可以用更强、且对几乎所有 LLM 都成立的假设补上。

配图里给出的修正版要点是:把原来的假设换成“查询得到的外积 $gi gi^T$ 张成对称矩阵空间”,并要求用来拟合的仿射二次设计矩阵具有合适秩。这样正交性结论仍然成立。作者还提到,后续相关论文虽然逐步靠近正确条件,但并没有明确指出原文 Lemma H.3 里的逻辑错误。

所属事件:ICML 2024大模型窃取论文作者承认定理有误(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →