Kimi K3 号称无需 RoPE 即可外推到 100 万 token
chaitjo · x · 2026-07-29
Kimi K3 的长上下文能力细节被截图补充出来:它不显式使用 RoPE,而是通过 KDA 的递归门控和衰减机制编码位置信息,因此可以不做位置编码改造直接外推到 100 万 token。
- 截图来自“Long-Context Extension”部分,明确写到模型不需要 RoPE scaling 或 interpolation。
- 这意味着它的长上下文扩展路线更偏“架构原生支持”,而不是后处理补丁。
「模型」频道最新
- 用户称 Anthropic Opus 5 个性化后变得几乎不可读 — himanshustwts · 2026-07-29
- Scobleizer 称 Grok 4.5 是当前最强编程模型 — Scobleizer · 2026-07-29
- Apple 据称起诉 OpenAI,指控未来硬件相关商业秘密被盗用 — emmanuelvivier · 2026-07-29
- Kimi K3 和 Qwen3.8 证明中国 AI 已成持续竞争力量 — emmanuelvivier · 2026-07-29
- 有人在找 1300 到 1700 美元、48GB 显存的本地 LLM 显卡 — Syosse-CH · 2026-07-29
- GPT-5.6 据称解开概率论长期开放问题 Feige 猜想 — MickeySteamboat · 2026-07-29