单节点跑通 Inkling Small:500ms 内实现原生语音交互

andimarafioti · x · 2026-07-31

开发者实测了 Thinking Machines 刚发布的 Inkling Small 模型。该模型仅需单节点(8x RTX Pro 6000 Blackwell)即可部署,而旗舰版则需要 2TB 显存。

测试中将其接入 Hugging Face 的语音到语音工作流,模型直接接收原始音频输入(而非转写文本),并使用 faster-Qwen3TTS 输出语音回复,端到端延迟低于 500ms。由于模型能直接“听懂”音频,它可以捕捉用户的语气和情绪,展现出极强的实时多模态交互潜力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →