把可解释性调查用作训练数据,让模型学会解释自身行为
a_karvonen · x · 2026-08-22
Anthropic 研究者补充其可解释性管线的后续:他们会把调查结果作为训练数据,教模型解释自己的行为。这种能力可以泛化到留出的分布外评测上,例如检测某个提示中的暗示是否改变了答案,不过效果随训练格式而异。
该管线还能在真实场景中暴露不忠实的思维链:例如让 Qwen3-8B 从列表中选一部剧时,它直接选了列表第一部,然后编造理由来支持这个选择。
所属事件:Qwen3-8B被曝先选答案再编理由,可解释性研究引关注(2 条相关)→
「研究」频道最新
- 皮尤研究:AI 生成内容增长主因是商业网站 — TuhinChakr · 2026-08-22
- 超越 Transformer 架构今年将成主流,MoE 与线性受关注 — PeterDiamandis · 2026-08-22
- 新论文 JAGGED JUDGES 探讨 LLM 评判者的确信度与稳定性 — ShirleyYXWu · 2026-08-22
- ID-V2V:SIGGRAPH 录用的身份保持视频风格迁移模型 — rsasaki0109 · 2026-08-22
- LeCun:高维参数空间使模型估计更易 — CSProfKGD · 2026-08-22
- FetchMan:纯仿真训练的视觉人形机器人策略 — kevin_zakka · 2026-08-22