Sentence Transformers v6.0 提速:fp16+FlashAttention 比 fp32 快 3.87 倍

tomaarsen · x · 2026-08-18

v6.0 的性能改进:多列损失(multi-column losses)现在对合并后的列只跑一次前向传播,在难负例与三元组训练上提速约 1.25 倍,且损失曲线完全一致;fp16 + FlashAttention 成为 Sentence Transformers 最快的 GPU 配置,相比 fp32 提速 3.87 倍。同帖还列出 v6.0 的破坏性变更:transformers v5 与 torch 2.2 成为最低版本要求、similarity/similaritypairwise 从属性改为方法、自定义模块类需 trustremotecode=True(含本地路径)、裸的聊天消息列表现在表示单个对话而非一个批次。

所属事件:Sentence Transformers v6.0 发布:晚交互多向量模型成一等公民(27 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →