专题 · FULL STORY
Flash Attention 致嵌入退化及官方修复始末
Sentence Transformers 启用 Flash Attention 2 导致文本打包引发静默退化,致使 BGE-M3 等模型掉点。官方随后发布 5.6.1 补丁修复了该 Bug。
2026-07-23 ~ 2026-07-23 · 2 集 · 5 条
第 1 集 · Flash Attention 致 BGE-M3 等模型掉点及底层原因(2026-07-23,2 条)
由于 Sentence Transformers 在启用 flash_attention_2 时会将纯文本 batch pack 成单序列,其 packed 位置编号与 RoBERTa 架构存在不兼容问题。这导致了严重的性能下降,例如 BAAI/bge-m3 模型在修复前的 STSB test Spearman 指标从 0.8485 大幅跌落至 0.7239。
- Sentence Transformers 的 packed 位置编号对 RoBERTa 不兼容 — tomaarsen · 2026-07-23
- BAAI/bge-m3 在 flash attention 下曾明显掉点 — tomaarsen · 2026-07-23
第 2 集 · Sentence Transformers 5.6.1 修复 Flash Attention 嵌入退化(2026-07-23,3 条)
文本表示库 sentence-transformers 发布 5.6.1 补丁版本,修复了此前启用 Flash Attention 2 导致的静默退化 bug。该问题主要影响 RoBERTa 和 XLM-R 家族模型,导致生成的向量出现异常。用户可通过 pip 命令更新至最新版本以解决此问题。
- Sentence Transformers 5.6.1 修复 flash attention 导致的嵌入退化 — tomaarsen · 2026-07-23
- Sentence Transformers 5.6.1 修复 RoBERTa 闪存注意力降质 bug — tomaarsen · 2026-07-23
- sentence-transformers 5.6.1 发布,修复 Flash Attention 致向量异常 — tomaarsen · 2026-07-23