重启 llama.cpp 导致长对话预填慢?建议实现 KV 状态自动存盘

Dazzling_Equipment_9 · reddit · 2026-08-20

用户在 128GB 设备上使用 llama.cpp 跑长上下文 Agent 会话(50k-100k tokens),发现频繁重启服务或调试参数时,每次都要重新预填上下文,耗时数分钟。虽然 llama-server 有 save/restore API,但用户希望服务端能自动处理:检测到对话 ID 返回时,自动从磁盘恢复缓存的 KV/prefill 状态,避免客户端显式集成。该功能对预填慢的硬件体验提升显著。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →