NexteraBERT 开源:65k 长文本推理比 ModernBERT 快 5.22 倍
udmrzn · x · 2026-09-23
开发者发布自研双向编码器模型 NexteraBERT(开源):
- 65k tokens 推理速度比 ModernBERT-base 快 5.22 倍
- 仅用 1/15 的训练 tokens,GLUE 与 ModernBERT-base 持平,MTEB v2 上反超
- 外推能力突出:8 倍训练长度下几乎不劣化(损失 +3.8% vs ModernBERT 的 +83%)
「研究」频道最新
- Perplexity 用提示引导自蒸馏训练 agent,失败率降至 1.77% — perplexity_ai · 2026-09-23
- Perplexity 披露训练数据管线:排除含 PII 及用户拒绝训练的会话 — perplexity_ai · 2026-09-23
- Perplexity 用提示引导自蒸馏训练 Computer 模型,工具调用失败率降 21.2% — perplexity_ai · 2026-09-23
- Kundaje 更新 ChromBPNet 预印本:直指 seq2PRINT 偏差校正「更优」说法为假 — anshulkundaje · 2026-09-23
- KostasVisualizations 上线 22 个交互可视化讲透 CV 背后的数学 — CSProfKGD · 2026-09-23
- DeepMind 研究员 Anshul Kundaje 指控 seq2PRINT 回避引用其先前工作 — anshulkundaje · 2026-09-23