开发者自研 KVA 投影器,本地推理 prefill 最高提速 1.85 倍
Public_Umpire_1099 · reddit · 2026-09-24
- Reddit 用户为 Qwen3.8 Flash Next 实现了受 DeepSeek V4.1 Flash 与 HySparse2/MiMo-V3 启发的 KVA 投影器(KV/激活预投影),在 2x R9700(128GB DDR5)本地环境跑通。
- 核心权衡:从不同层开始启用投影,速度与困惑度可调——layer 12 起 prefill 1700→3150 t/s(+8% ppl),layer 16 起 2900 t/s(+5%),layer 24 起 2500 t/s(+2.6%)。
- 与其他实现不同:每层用 Tikhonov 岭回归整映射(约 1.5GB 显存),只预测后层输入、由真实权重算 key/value;起始层可自选而非锁定 24 层。作者称继续训练收益几乎为零,关键在架构杠杆。
- 第二版多层投影器初步达 1.55x 提速仅 +2% ppl,作者认为可做到 1.5x 提速且 ppl 增加 <1%。V1 已稳定可直接在 R9V 使用,V2 需 --ced quality 开关,HF 已放出 IQ4XS 模型与投影器仓库。
「Infra」频道最新
- 曝 AI 芯片创企 DensityAI 拟融资数亿美元,估值 100 亿美元 — steph_palazzolo · 2026-09-25
- 曝 xAI 三个月内点亮 66 万张 GB300,年底 GPU 总量达 144 万 — ns123abc · 2026-09-25
- Epoch AI 图表:同等智能水平 AI 价格持续跳水,降幅超其他技术 — jeff_weinstein · 2026-09-25
- 多智能体通信催生新基建:Agent 间的「全局总线」会是下一个原语 — madhavsinghal_ · 2026-09-25
- 投资人预言:3-5 年内芯片到 PCB 设计将融合成一条连续流 — ai · 2026-09-25
- 高通 2nm 骁龙8至尊版发布:CPU 首破 5GHz,全线为智能体重写架构 — 量子位 · 2026-09-25