离线 LLM 在 iPhone 上到底能拿来做什么
James333i · reddit · 2026-07-26
这是一条关于 iPhone 上离线小模型 的长讨论:大家到底会把它们用在哪些场景里?
作者表示自己过去一年一直在手机硬件上测试 开源 MLX 和 GGUF 模型,整理出一些比较实用的用法:
- Apple Foundation model 能力不强,但在 工具调用、快速 摘要 和 分类 上很有用,适合先做预处理再交给更强模型。
- 在高端机型上,0.5B 到 8B 的模型都能跑出可用效果。
- 目前试过的场景包括:
- 网页搜索和 URL 抓取
- 内容摘要
- 研究辅助
- 本地照片、视频、文档分析
- 轻量的随身编程帮助
- 通过 continuous compaction,即使上下文窗口只有 8k–16k tokens,也能把对话维持得近似“无限长”。
- 另一个值得探索的方向,是用于 私密、离线的个人聊天。
作者想问的是:相比笔记本和桌面端,手机端模型是不是还被严重低估了。
「Infra」频道最新
- 不同推理厂商各有 SLA 侧重,Together/Modal/Fireworks/Cerebras 值得关注 — abhijithneil · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11