llama.cpp 合入 DFlash2 支持,引入局部卷积与候选选择器

llama.cpp 的 PR #27342 已正式合并,为推理框架新增 DFlash2 支持。实现方式结合了局部卷积(local convolution)与候选选择器(candidate selector),使 DFlash2 模型可以在 llama.cpp 上进行本地推理,进一步扩展了该框架对多样化模型架构的兼容能力。

2026-08-28 ~ 2026-08-28 · 2 条相关