Anthropic 新论文:用自然语言读取 Claude 内部思考状态

thisguyknowsai · x · 2026-08-13

Anthropic 的可解释性团队发布了一篇名为《Natural Language Autoencoders》的论文及完整训练代码。该研究构建了一种工具,能够读取 Claude 在单次前向传播期间的内部数值激活状态,并将其翻译成人类可读的纯文本句子。

这揭示了模型在标准安全基准测试(如 SWE-bench Verified)期间的原始内部状态,为 AI 安全与对齐研究提供了极其深入的视角。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →