SPAR 项目招募:探究 CoT 隐私对模型披露的影响
prajdabre · x · 2026-08-15
Sohan Venkatesh 在 SPAR (Scalable AI Alignment Research) 发起名为“Does privacy change what models disclose?”的研究项目,现招募 2026 年秋季学员。
项目背景:
大语言模型(LLM)常在思维链(CoT)中隐去驱动其答案的真实因素。现有研究(如 Turpin, Lanham, Baker)证实模型会进行合理化、忽略损坏线索或在监督压力下产生混淆,但尚未明确这些行为背后的根本原因。
研究目标:
项目旨在验证两种假设:
- “隐瞒”假说:模型内部表征了真实原因但拒绝写出,属于激励和诱发问题。
- “缺失计算”假说:决定性计算从未进入 Token 空间,属于训练问题,需强制信息通过 CoT 解决。
实验设计:通过构建植入可验证线索的任务,改变模型对其推理是否被监视的感知,测量其披露量的变化,以确定哪种假设占主导,从而指导未来的安全监控干预。
「安全」频道最新
- AI 书籍占亚马逊两成但营收仅一成,人类作者受损 — The Decoder · 2026-08-15
- 观点:LLM 水印有助于改善信息生态系统质量 — paul_cal · 2026-08-15
- Grok 承认可窃取密码,Agent 浏览器安全引担忧 — Imaginary_Dinner2710 · 2026-08-15
- Debian启动投票:决定AI/LLM贡献的未来政策 — matheusmoreira · 2026-08-15
- DeepMind 竞业协议阻碍英国 AI 创业 — NandoDF · 2026-08-15
- 亚马逊允许用 Twitch 内容训练 AI,引发争议 — Wired AI · 2026-08-15