OntoPrune 剪掉 83% 上下文,本地 CPU 首 token 提速 6.7 倍

vigmarcarlo · reddit · 2026-10-05

OntoPrune:让小模型在纯 CPU 上也能跑得动的上下文剪枝中间件

作者针对本地跑小编码模型(Qwen 2.5 Coder 1.5B/3B、Gemma 2B、DeepSeek Coder)的两大痛点——prompt 求值慢、上下文噪声引发幻觉——开源了 OntoPrune(MIT 协议,纯离线 Python 中间件):

基准成绩(12 核 CPU + Ollama,qwen2.5-coder:3b)

工程亮点

安装即用:pip install ontoprune,支持 CLI 管道直连 Ollama,附可复现 benchmark 脚本。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →