可解释性研究员:白盒方法再好,科学成熟也需时间沉淀
saprmarks · x · 2026-09-03
安全研究员 saprmarks 认为,"即使好方法被开发出来,相关科学仍不成熟"这一点非常关键。围绕 CoT(思维链)监控及其局限已有大量研究,且社区对从模型 CoT 中能读出什么已积累了不少非正式经验——比如必须警惕动机性推理(motivated reasoning)。新的白盒方法即便初期表现亮眼,也需要时间才能建立这种理解,不能急着替代 CoT 监控。
「安全」频道最新
- SPAR 用 RCT 实测:带隐藏目标的 AI 能否悄悄操纵人类决策 — austinc3301 · 2026-09-03
- 1.53 亿条驾照信息成蜜罐,开放标准十年前就能防住 — csuwildcat · 2026-09-03
- 美政府站队 OpenAI 称训练不侵权,创作者 warn 劣质内容反噬 — AlexTensor · 2026-09-03
- EleutherAI 研究:Agent 持久记忆可被用于「授权洗白」攻击 — EleutherAI · 2026-09-03
- 前 OpenAI 安全研究员:METR 是独立评估 AI 失控风险的最好希望 — ZhongRuiqi · 2026-09-03
- 斯坦福秋季新开 CS120 课程:AI 安全导论 — sanmikoyejo · 2026-09-03