用标准工具调用即可套出 GPT-6 等模型隐藏思维链
jiqizhixin · x · 2026-10-07
奥尔堡大学 AI 安全实验室与开源社区 Seafill 发布研究「Capable yet Parsimonious」:仅用标准 API 工具调用协议,就能让 GPT-6、Claude 等多个前沿闭源模型把内部隐藏的类推理思维链外化输出。
- 闭源模型通常只给最终答案或加工过的思维链,真实推理过程被隐藏;该工作提出协议层提取方法,无需访问内部即可获得隐藏推理。
- 在可观察原生思维链的开源模型上验证,提取出的推理在准确性上持平甚至超过原生思维链。
- 所有提取实验在 2026 年 9 月 9 日前完成,团队已正式通知 OpenAI 和 Anthropic。
「安全」频道最新
- LLM 出口安全之辩:工具调用皆可被中间人代理监控 — evilsocket · 2026-10-07
- 开发者怒批 Windsurf「dots」:限制多、不兼容本地,疑似逼数据上云 — sethlazar · 2026-10-07
- Anthropic 初创计划条款曝光:可复用你的创意并做安全审查 — DominiqueCAPaul · 2026-10-07
- Jozu Agent Guard 用 microVM 沙箱管住 YOLO 模式的 Claude Code 与 Cursor — Arindam_1729 · 2026-10-07
- 「识别你的 Agent」协议兴起,或成智能体生态新基建 — annetgriffin · 2026-10-07
- National Compute Grid 上线数百个 MI355X 与 B300 节点,补贴教育政府机构 — typewriters · 2026-10-07