模型窃取论文证明需更强张成假设,作者已修正

ArthurConmy · x · 2026-08-04

这条线程把论文、讨论群和作者自己的旧帖串起来,说明原先那个证明确实有错误,但论文里更大的核心结论仍然成立。

被引用的论文《Stealing Part of a Production Language Model》讲的是一种黑盒模型窃取攻击:在典型 API 访问下,可以恢复生产级 LLM 的嵌入投影层、隐藏维度,甚至在低成本查询下拿到完整投影矩阵。作者这次补充说,证明需要更强的张成假设;相关后续工作已经在接近正确条件,但并没有直接指出原 lemma 的错误。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →