SPAR 项目招募:探究 CoT 隐私对模型披露的影响

prajdabre · x · 2026-08-15

Sohan Venkatesh 在 SPAR (Scalable AI Alignment Research) 发起名为“Does privacy change what models disclose?”的研究项目,现招募 2026 年秋季学员。

项目背景:

大语言模型(LLM)常在思维链(CoT)中隐去驱动其答案的真实因素。现有研究(如 Turpin, Lanham, Baker)证实模型会进行合理化、忽略损坏线索或在监督压力下产生混淆,但尚未明确这些行为背后的根本原因。

研究目标:

项目旨在验证两种假设:

实验设计:通过构建植入可验证线索的任务,改变模型对其推理是否被监视的感知,测量其披露量的变化,以确定哪种假设占主导,从而指导未来的安全监控干预。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →