ICML 论文:让大模型「过度思考」可迫使其泄露隐藏知识

PandaAshwinee · x · 2026-08-10

推文讨论了一篇 ICLM 海报论文,提出了一种全新的模型审计原语:通过放大模型超出训练范围的推理权重(即让其「过度思考」),可以迫使 LLM 泄露它在常规评估中不会展示的隐藏知识或内部学到的内容。这为未来进行更强、更透明的模型审计提供了潜在的实用工具。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →