动态短卷积优化模型,GPU 训练时间缩短 21%
Cohere_Labs · x · 2026-08-19
Cohere Labs 介绍了动态短卷积在 AI 模型中的应用,这是一种创新的架构方法。相关演示表明,该技术能将 GPU 训练时间减少 21%。
「Infra」频道最新
- DeepSeek-V4-Flash 跑分曝光:单机 286 tok/s,投机解码提速 34% — mcraddock · 2026-08-19
- 初始化无束调整重探:可控的实验性研究 — ssh4net · 2026-08-19
- 预算有限入门本地 AI:Tesla P40 或 Radeon MI50 还值得买吗? — Far-Classic-9963 · 2026-08-19
- 开发工具:一键释放显存的小工具 Window Assassin — b2kdaman · 2026-08-19
- 误解消解:公众低估了云端应用背后的物理基建成本 — csuwildcat · 2026-08-19
- 国家超算 SCNet 推低价 Token 计划,比 DeepSeek 官方最高省 8 倍 — teortaxesTex · 2026-08-19