研究团队质疑 LLM 内省能力 现有证据不足

NVIDIA 与约翰霍普金斯大学研究员 Tal Linzen 团队预告,将在下周 COLM 会议上展示对 Anthropic 模型内省实验的怀疑性分析。其 arXiv 论文《Can LLMs Introspect? A Reality Check》指出,现有证据不足以证明大语言模型能够内省自身内部状态,对 Anthropic 此前的内省实验结论提出质疑。

2026-10-02 ~ 2026-10-02 · 2 条相关