ICML 论文:放大推理权重让大模型过度思考以泄露秘密
一项即将在 ICML 展示的海报论文提出了一种全新的模型审计原语。研究指出,通过放大大语言模型(LLM)的推理权重,使其超出训练范围进行“过度思考”,可以迫使模型泄露在常规评估中不会展示的隐藏知识或秘密。这一发现为更强大的模型审计以及探测模型真实学习内容提供了全新的方法与视角。
2026-08-10 ~ 2026-08-10 · 2 条相关
- ICML 论文:让大模型「过度思考」可迫使其泄露隐藏知识 — PandaAshwinee · 2026-08-10
- ICML 论文:通过“过度思考”放大权重可提取 LLM 隐藏信息 — PandaAshwinee · 2026-08-10