新论文称解码器 LLM 可注入并可精确还原输入文本
s_scardapane · x · 2026-07-29
Language Models are Injective and Hence Invertible 认为,decoder transformer 把离散输入序列映射到连续隐藏表示时是可注入的,因此理论上可以从激活中精确恢复输入文本。
- 作者给出数学证明:这种性质在初始化时成立,并在训练过程中保持。
- 他们在 6 个 SOTA 语言模型上做了数十亿次 collision 测试,没有观察到碰撞。
- 论文进一步提出 SipIt,一种能够从隐藏激活中线性时间、可证明地重建原始文本的算法。
- 作者认为,这一性质对透明度、可解释性和安全部署都有直接意义。
「研究」频道最新
- 2010 年代末生成式 AI 回顾:BigGAN、StyleGAN 与旧笔记本 — Merzmensch · 2026-07-29
- ACL 研究发现非英语维基百科质量问题严重 — mdlhx · 2026-07-29
- 新研究发现:人类 TSP 解近乎最优,但仍有稳定人类偏差 — xuanalogue · 2026-07-29
- Google 研究 1500 万次 Gemini 交互:白领大规模被自动化证据不足 — ChuckDBrooks · 2026-07-29
- 腾讯开源 AngelSpec,推理加速最高可达 2.4 倍 — teortaxesTex · 2026-07-29
- ICLR 2027 截止日早于 NeurIPS 2026 录用结果 8 天 — 1414vo · 2026-07-29