单节点跑通 Inkling Small:500ms 内实现原生语音交互
andimarafioti · x · 2026-07-31
开发者实测了 Thinking Machines 刚发布的 Inkling Small 模型。该模型仅需单节点(8x RTX Pro 6000 Blackwell)即可部署,而旗舰版则需要 2TB 显存。
测试中将其接入 Hugging Face 的语音到语音工作流,模型直接接收原始音频输入(而非转写文本),并使用 faster-Qwen3TTS 输出语音回复,端到端延迟低于 500ms。由于模型能直接“听懂”音频,它可以捕捉用户的语气和情绪,展现出极强的实时多模态交互潜力。
「Infra」频道最新
- 开源项目收录 LLM 部署隐蔽陷阱 — alexcovo_eth · 2026-07-31
- 解码速度达 1万 token/秒,会解锁哪些 LLM 新场景? — LivingSwitch · 2026-07-31
- 推理优化带来10倍以上性能提升,GPU算力或重演暗光纤革命 — chandan1_ · 2026-07-31
- 斯坦福学者提出用「每瓦特智能」衡量 AI 效率 — StanfordAILab · 2026-07-31
- 数据中心耗水问题引关注:新一期播客探讨 — AndyMasley · 2026-07-31
- DeepSeek计划建设1GW数据中心,Anthropic目标9-10GW — zephyr_z9 · 2026-07-31