Marin 社区实验:YOCO 变体复用中点激活替代 KV,有效加速达 1.12 倍
liliang_ren · x · 2026-09-09
Marin 开源训练社区的一个 agent 生成实验:在 YOCO 风格注意力上,让后半层所有层的 K/V 不再取自各自的残差流,而是共享一个中点(midpoint)激活。参数与层数完全保留。
在三个固定种子实验中,d512/d768/d1024 三个宽度的终端 Paloma loss 全部下降(如 d512 从 3.5794 降至 3.5570),训练吞吐仅损失 0.6-0.7%,综合有效加速分别为 1.121x/1.025x/1.077x。核心动机在推理 prefill:前半层算完后,上半部分缓存只需各层做 K/V 投影 GEMM。
「研究」频道最新
- NYU 数学家指控 OpenAI「抄袭式竞赛」:烧 2250 万美元算力抢发 Navier–Stokes 证明 — SumitGup · 2026-09-09
- OpenAI 仅训 11 天的模型参与破解千禧年难题,万级 agent 分组协作 — peterwildeford · 2026-09-09
- Anima Anandkumar 回击:物理中心 AI 已落地天气与医疗器件设计 — AnimaAnandkumar · 2026-09-09
- ECCV 2026 半天教程系统讲透视觉基础模型与世界模型评测 — gowthami_s · 2026-09-09
- OpenAI 宣称用内部模型与 1 万并发 Agent 解出 Navier-Stokes 百年难题 — The Verge AI · 2026-09-09
- ValsAI 发布 Tax Agent Bench:391 道专家题考 LLM 企业税务研究 — JenniferHli · 2026-09-09