模型窃取论文证明需更强张成假设,作者已修正
ArthurConmy · x · 2026-08-04
这条线程把论文、讨论群和作者自己的旧帖串起来,说明原先那个证明确实有错误,但论文里更大的核心结论仍然成立。
被引用的论文《Stealing Part of a Production Language Model》讲的是一种黑盒模型窃取攻击:在典型 API 访问下,可以恢复生产级 LLM 的嵌入投影层、隐藏维度,甚至在低成本查询下拿到完整投影矩阵。作者这次补充说,证明需要更强的张成假设;相关后续工作已经在接近正确条件,但并没有直接指出原 lemma 的错误。
「研究」频道最新
- Kempner Institute 面向博士后开放 AI 研究员项目 — jefrankle · 2026-08-04
- 神经算子通过偏离物理约束提前预警临界点 — AnimaAnandkumar · 2026-08-04
- SALT 用 trie 管聊天记忆,但主题检索仍会取回太多内容 — No_Sky9786 · 2026-08-04
- 83 Sciences 称前沿模型可用隐藏实验数据发现新材料 — ycombinator · 2026-08-04
- 为什么“有趣”很难只靠示例学出来 — dioscuri · 2026-08-04
- Scobleizer 会见 GoodfireAI,聊 AI 可解释性研究 — Scobleizer · 2026-08-04