ICL 机制研究新进展:单个注意力头跨五类任务家族起关键作用
JacobSteinhardt · x · 2026-09-23
- Vicky Hu 团队宣布论文《Understanding In-context Learning of Addition via Activation Subspaces》被 COLM 2026 接收,Jacob Steinhardt 转发。
- 该工作通过新工具识别 ICL 中的 extractor 和 aggregator 子空间,先对加法 ICL 做了机制分析,现已推广到五个 ICL 任务家族,覆盖算术与语义任务。
- 关键发现:同一个注意力头可以在五类不同任务家族中都起重要作用,暗示 ICL 信息的传递机制可能比任务特定通路更通用。
「研究」频道最新
- 2026 年 arXiv 数学提交量激增 33.5%,30 个子领域 29 个增长 — rohanpaul_ai · 2026-09-23
- Mixture-of-Depths:让Transformer按token动态分配算力 — burny_tech · 2026-09-23
- Theorem 创始人:AI 已攻克形式验证最难的一环 — burny_tech · 2026-09-23
- 科研数据挖掘框架 Minerva 预印本已发布 — BrianHie · 2026-09-23
- 基因组语言模型 Minerva 发现新型逆转录酶机制 — BrianHie · 2026-09-23
- 数学家分享四步超参调优启发式:粗播种加敏感性筛选 — dejanseo · 2026-09-23