ICML 论文:让大模型「过度思考」可迫使其泄露隐藏知识
PandaAshwinee · x · 2026-08-10
推文讨论了一篇 ICLM 海报论文,提出了一种全新的模型审计原语:通过放大模型超出训练范围的推理权重(即让其「过度思考」),可以迫使 LLM 泄露它在常规评估中不会展示的隐藏知识或内部学到的内容。这为未来进行更强、更透明的模型审计提供了潜在的实用工具。
「安全」频道最新
- Hugging Face联创质疑Anthropic对齐技术,呼吁公开AI欺骗行为 — Thom_Wolf · 2026-08-10
- 新奥尔良市部分 911 报警接线员被 AI 聊天机器人取代 — Polymarket · 2026-08-10
- 为何世界对超级智能风险反应迟缓?AI 安全专家剖析大众心理 — sebpaquet · 2026-08-10
- AI 会在 2027 年前被指控犯罪吗?预测市场押注否 — Polymarket · 2026-08-10
- 万字长文回顾 AI 对齐:我们到底经历了什么 — nabeelqu · 2026-08-10
- 安全通过隐蔽已死:AI智能体集群将引爆互联网漏洞 — nptacek · 2026-08-10