可解释性进展引激辩:LLM 算法洞见离目标还很远?
可解释性研究者 stuhlmueller 坦承进展远逊预期:2023 年 5 月他曾估计到 2026 年底有 50/50 的概率能从 LLM 中提取算法洞见,如今看来距离目标还很远。aryaman2020 则反驳,质疑 induction heads、function vectors 等发现为何不算达成目标。讨论还围绕 Eliezer Yudkowsky 对 LLM「前所未有行为」的定义展开,例如「能像人一样说话」是以往任何 AI 算法都做不到、且其原理尚不清楚的能力。
2026-09-03 ~ 2026-09-03 · 3 条相关
- 可解释性学者坦承进展远逊预期:距从 LLM 提取算法洞见还很远 — stuhlmueller · 2026-09-03
- 回应质疑:induction heads 等发现是否算 LLM 算法洞见之辩 — aryaman2020 · 2026-09-03
- induction heads 算不算 LLM 的全新能力?研究者在线激辩 — aryaman2020 · 2026-09-03