Kimi 推出新注意力架构:推理快 6 倍、显存省 75%
pstAsiatech · x · 2026-08-25
- 核心突破:Kimi 发布了一种新的注意力架构,运行速度比全 attention 快 6 倍,显存占用减少 75%。
- 技术背景:传统 Transformer 受限于“全注意力”,上下文增长导致算力成本爆炸;而以往的“线性注意力”虽然快,但性能不如标准模型。
- 意义:该架构在保持高性能的同时解决了长上下文处理的效率和成本瓶颈,有望加速长文档和大规模代码库的应用。
「模型」频道最新
- Grok 4.6 在 Nous Portal 限时五折 — NousResearch · 2026-08-25
- 测试显示 Qwen 3.8 27B 在低比特量化下表现优于高比特 — rohanpaul_ai · 2026-08-25
- Atomic Chat 发布 Qwen 3.8 27B GGUF 量化模型集合 — rohanpaul_ai · 2026-08-25
- MiniMax 官宣:GMI Cloud 上 M3/M2.7 等 14 天无限量免费 — MiniMax_AI · 2026-08-25
- 用户称 Ox Alpha 持续变强,推测具备每日自我修改能力 — kimmonismus · 2026-08-25
- Anthropic 抱怨蒸馏遭反驳:Kimi、GLM 已免费提供前沿能力 — Leafytreedev · 2026-08-25