笔记本+eGPU 跑本地推理

jupiterbjy · reddit · 2026-07-19

作者分享了一种“穷人版”移动本地推理方案:在笔记本上折腾 **llama.cpp** 参数,用有限硬件跑 **Qwen3.6 30B A3B**。 帖子里提到的体验点包括: - 通过调整 llama.cpp 参数,让一次性的低配硬件也能跑起来; - 最近新增的 llama.cpp 内置 Web UI 很轻量,初始加载大约只有 **3MB** 的 JS/CSS; - 目前的工具调用功能**没有 sandbox**,作者也明确提醒这点并觉得“很有意思但不安全”; - 配图展示了笔记本 + eGPU + 本地推理监控界面,强调的是实际跑起来的部署感受。 整体上这是一个很典型的**本地部署 / 端侧推理折腾帖**,重点在工程实践而不是模型本身。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →