ICML 论文:放大推理权重让大模型过度思考以泄露秘密

一项即将在 ICML 展示的海报论文提出了一种全新的模型审计原语。研究指出,通过放大大语言模型(LLM)的推理权重,使其超出训练范围进行“过度思考”,可以迫使模型泄露在常规评估中不会展示的隐藏知识或秘密。这一发现为更强大的模型审计以及探测模型真实学习内容提供了全新的方法与视角。

2026-08-10 ~ 2026-08-10 · 2 条相关