开发者推出终端本地语音输入插件,基于Nemotron ASR
Danmoreng · reddit · 2026-08-07
一位开发者发布了专为终端编程打造的本地语音输入扩展 talk-to-pi。该工具基于 NVIDIA 刚发布的 Nemotron 3.5 ASR 0.6B 模型和 GGML 运行时,无需额外运行服务器即可在 CPU 上实现足够流畅的实时多语言语音转文字。
插件设计极简,首次使用时会自动下载约 700MB 的模型。用户可通过快捷键唤起语音输入,识别结果可直接填入提示词输入框并进行编辑。作者表示,目前的编程智能体已经足够聪明,能够自行理解不太准确的转录文本,因此无需额外引入 LLM 进行文本清理。
「编程与Agent」频道最新
- 破解AI智能体资金孤岛:开源金融栈Mandate实现自主赚钱与流转 — RichardsonDx · 2026-08-07
- Pydantic 作者谈 AI 编码工具:宁愿闲置免费额度也不用 OpenAI — samuelcolvin · 2026-08-07
- Mediabunny 优化大文件流式读取:支持边下边播与内存控制 — Vjeux · 2026-08-07
- 展望 AI 与 AI 交互闭环:智能体将代你向服务商提需求 — DanielLockyer · 2026-08-07
- Claude Code 体验遭吐槽:开发者宁愿放弃免费额度也不忍工具缺陷 — intellectronica · 2026-08-07
- AI工程正演变为系统设计,上下文与路由成核心 — Deep_Ladder_4679 · 2026-08-07