机械可解释性发现简单 LLM 中大量泛化连接

机械可解释性研究显示,即便在最简单的 LLM 中也存在大量泛化性连接:模型一旦形成正确连接,便可超越死记硬背、支持泛化。有讨论进一步提出三层理解框架来刻画这些连接,即概念理解、世界状态理解与原理性理解,用以说明 LLM 所展现的泛化能力及其理解层级。

2026-09-27 ~ 2026-09-27 · 2 条相关