实验室新实验首次诱导并观测 LLM 忠实内省的神经足迹

davidbau · x · 2026-10-06

David Bau 介绍其实验室 @diatkinson 基于 @dillonplunkett 的 Self-Interpretability 协议(arXiv:2505.17120)开展的一系列实验,首次在开源模型上诱导并直接观测「内省」:

结论:同一个模型既可能给出深刻准确的「我认为 X」,也可能随机鹦鹉式地撒谎;内省与泛化之间存在直接可测的神经联系。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →