3B 角色扮演模型全量跑在 iPhone:内存、上下文与角色保持的实测笔记
Low-Future-9387 · reddit · 2026-10-09
Castmates 开发者分享了在 iPhone 本地运行 3B 角色扮演模型(Impish Llama 3B + rank 16 LoRA,量化到 Q4KM,约 2GB)的完整工程细节。
部署方案
- llama.cpp + Metal,全层 offload,KV cache 用 q80(每 token 约 60KB),无服务器、可离线
- 按内存分档:4GB 手机限 4096 上下文,6GB 给 6144,8GB 给 8192;A18 芯片早期测得约 6 tok/s
- 2GB 下载是最大流失点,用 Background Assets 在首次启动前预载
角色保持的关键发现
- 上下文窗口大小本身没用,真正瓶颈是历史裁剪预算;裁剪比例调到约 0.68×nctx 后长对话事实召回从 25% 升到 75%,逐字历史远胜有损摘要
- BM25 检索会重新注入已被覆盖的旧事实(+20.8pp 过期率);过滤掉窗口内仍有新版本的命中后过期率降 18.8pp
- Prompt 措辞改动几乎测不出效果(单次跑全是噪声,需 N=16 同种子对照);位置比措辞重要——场景指令放在 reminder 槽 0/16 生效,作为最后 user turn 后的独立块则 16/16
- 对 3B 的顽固习惯用代码守卫(重 roll 人称漂移、编造人名等)比 prompt 有效;思考模式反而无益
模型仍无法覆盖上下文中可读到的旧事实,这是模型本身的天花板。所有结论都来自固定种子的实验室复测,非主观感受。
「编程与Agent」频道最新
- Jerry Liu:定义 eval 然后爬山优化,可解几乎任何任务 — hwchase17 · 2026-10-09
- AI 日报:GPT-6.1 Sol 速度最高快 8 倍,Claude 仪表盘与动画功能开测 — testingcatalog · 2026-10-09
- 把 Anthropic 的 AI 原生 SDLC 打造成规模化软件工厂 — Pavan_Belagatti · 2026-10-09
- Satori 下版大幅扩容 CSS 支持:3D 变换、calc、min/max/clamp 全来 — shuding · 2026-10-09
- 微软老将谈 vibe coding 边界:AI 能写代码,但架构判断仍离不开人 — mjuric · 2026-10-09
- shadcn谈AI时代最重要的编码技能:别让Agent替你读 — shadcn · 2026-10-09