oMLX 长会话内存溢出卡死?给 Pi 加触发词实现自动压缩上下文

chibop1 · reddit · 2026-08-18

用户反馈用 Pi agent 跑 oMLX 时,长会话容易遇到内存溢出导致 agent 直接停止,即使把 Memory guard 设为 aggressive、上下文长度设置合理也无法避免,需要手动 compact 再恢复。

作者的解法是给 Pi 增加一个压缩触发词:克隆 omlx 仓库,编辑 packages/ai/src/utils/overflow.ts,在 /token limit exceeded/i 一行下面加上 /reduce context/i,然后重新 npm install && npm run build 并全局安装 coding-agent 包。

原理是 oMLX 遇到上下文相关问题时会发送带 "reduce context" 字样的停止错误消息,这样 Pi 无论是否真正超出设定的上下文长度,都能据此自动压缩。最终作者得以让 qwen-3.8-27b 通宵连跑数小时。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →