可解释性进展引激辩:LLM 算法洞见离目标还很远?

可解释性研究者 stuhlmueller 坦承进展远逊预期:2023 年 5 月他曾估计到 2026 年底有 50/50 的概率能从 LLM 中提取算法洞见,如今看来距离目标还很远。aryaman2020 则反驳,质疑 induction heads、function vectors 等发现为何不算达成目标。讨论还围绕 Eliezer Yudkowsky 对 LLM「前所未有行为」的定义展开,例如「能像人一样说话」是以往任何 AI 算法都做不到、且其原理尚不清楚的能力。

2026-09-03 ~ 2026-09-03 · 3 条相关