本地语音助手按显存自动选模型,Arduino 灯光显示工作状态

PrimeEmre · reddit · 2026-10-04

开发者分享一个本地 JARVIS 式语音助手侧项目:Flask 应用通过 Ollama 调用本地模型回答问题,用 DuckDuckGo 搜索做事实 grounding,本地 TTS 服务器朗读回复,并用 Arduino Uno 显示工作状态(串口发一个字节:B=检索中、Y=思考中、W=完成,对应蓝/黄 LED 脉冲和舵机摆动)。

最实用的设计是按显存自动分层选模型:启动时从 nvidia-smi 读取总显存并选择档位——24GB 选 qwen2.5:32b(16k 上下文、8 条搜索结果),16GB 选 14b,8GB 选 llama3.1:8b,最低档跑 qwen2.5-coder:1.5b,48GB 可上 72b;OVERRIDEMODEL 环境变量可跳过检测。搜索结果条数也随模型规模缩放,避免小模型被上下文淹没。

语音用 OmniVoice Studio 的 OpenAI 兼容本地 API;若空闲显存不足 5GB,可切换到纯 CPU 的 KittenTTS。代码与详细搭建步骤均已开源,作者还讨论了「显存分层选模型 vs 直接让 Ollama 卸载层到内存」的取舍。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →