模型窃取论文作者承认原始定理有误,但可修正
ArthurConmy · x · 2026-08-04
作者承认自己在《Stealing Part of a Production Language Model》里证明过的一个原始结论写错了,但这个错误可以用更强、且对几乎所有 LLM 都成立的假设补上。
配图里给出的修正版要点是:把原来的假设换成“查询得到的外积 $gi gi^T$ 张成对称矩阵空间”,并要求用来拟合的仿射二次设计矩阵具有合适秩。这样正交性结论仍然成立。作者还提到,后续相关论文虽然逐步靠近正确条件,但并没有明确指出原文 Lemma H.3 里的逻辑错误。
所属事件:ICML 2024大模型窃取论文作者承认定理有误(2 条相关)→
「研究」频道最新
- Kempner Institute 面向博士后开放 AI 研究员项目 — jefrankle · 2026-08-04
- 神经算子通过偏离物理约束提前预警临界点 — AnimaAnandkumar · 2026-08-04
- SALT 用 trie 管聊天记忆,但主题检索仍会取回太多内容 — No_Sky9786 · 2026-08-04
- 83 Sciences 称前沿模型可用隐藏实验数据发现新材料 — ycombinator · 2026-08-04
- 为什么“有趣”很难只靠示例学出来 — dioscuri · 2026-08-04
- Scobleizer 会见 GoodfireAI,聊 AI 可解释性研究 — Scobleizer · 2026-08-04