Pi + llama.cpp 跨会话缓存 20k 初始提示词,秒开新会话
ea_man · reddit · 2026-09-28
作者分享了一个给本地 Pi 编程助手 + Qwen 27B 复用 prompt prefill 的实战技巧:Pi 的初始 prompt(含扩展、工具、append.md)会膨胀到 20k token,每次新会话都要重新 prefill,很慢。
做法
- 安装作者写的 Pi 扩展 pi-prefix-cache.tgz
- 给 llama.cpp 打 kvprefixcheckpointsidecar 补丁(跨会话持久化缓存绕不开)
- 使用 Froggeric 的 Qwen chat template(新旧模型通用)
关键参数
--slot-save-path ... --ctx-checkpoints 32 --checkpoint-min-step 4096 -np 1 --chat-template-file chattemplate3.8.jinja
缓存按 ubatch 边界切块,需注意 batch 大小;需配置 PIPREFIXCACHEBASEURL / PIPREFIXCACHEPERSIST=1 / PIPREFIXCACHESLOTDIR 环境变量。作者提醒此法不简单,适合熟悉手动打补丁的用户,更多变量说明见扩展 README。
「编程与Agent」频道最新
- 一条 prompt 让 Opus 一次性生成滚动漫画风时间线网站 — thomas_unise · 2026-09-28
- 用任务 DAG 模拟器低成本预演 agent 集群行为 — KyeGomezB · 2026-09-28
- 开发者借 AI 学 TLA+ 形式化验证,修 Nethack bug 时竟发现自己修复方案有漏洞 — davidbau · 2026-09-28
- 开发者晒由 Opus 驱动的游戏开发团队 Spawn — majidmanzarpour · 2026-09-28
- 开源 Mailflare 基于 Cloudflare 打造自托管邮箱,新增 MCP 与 AI 助手 — alexcovo_eth · 2026-09-28
- 一个月内从拒斥到信任:用户让 Muse agent 完成价值 3000 美元旅行预订 — armand_ruiz · 2026-09-28