Attention Relay 免训练迁移 LLM 指令遵循能力给文本嵌入模型
_reachsumit · x · 2026-10-06
arXiv 论文提出 Attention Relay:把指令微调 LLM 产生的注意力权重直接传给嵌入模型的注意力池化,使嵌入器无需任何训练即可遵循任务指令。
- 动机:对比学习训练的嵌入模型需指令配对数据才能学指令遵循,而指令微调 LLM 天然会跟指令
- 在 Qwen3、Llama 3.1、OLMo 3 三族共 6 个指令 LLM 与 10 个不同分词器/规模/池化方式的嵌入模型上,几乎每组组合都变得指令感知
- 分析显示 LLM 后层注意力权重追踪指令且主要来自指令微调;中继这些权重能让指令要求的文本维度在嵌入中占主导
「模型」频道最新
- Sander Dieleman 长文:连续扩散语言模型为何卷土重来 — LucaAmb · 2026-10-06
- 30B 激活参数打平 480B+ 模型:ROME 智能体基准成绩公布 — thisguyknowsai · 2026-10-06
- Reflection AI 发布 501B-A23B 模型 Beam,跑分介于 GLM 5.2 与 5.3 之间 — iaziaz · 2026-10-06
- 博主对比:$200 Claude Max 比 $500 ChatGPT 更耐用更快更强 — AlchainHust · 2026-10-06
- FLUX 3 登顶 DeepMind 物理理解基准 Physics-IQ 榜首 — bfl_ai · 2026-10-06
- Reflection 新开源模型不敌中国主力模型,融资数十亿遭群嘲 — npinto · 2026-10-06