阶跃发布 StepAudio 3 Realtime,边说边想实现实时语音推理
stepfun-ai · hf · 2026-09-16
阶跃星辰发布 StepAudio 3 Realtime 技术报告,这是一个围绕「听-说-思-动」持续循环组织的音频语言基础模型。
- Deep Perception:捕捉丰富声学线索以理解用户意图
- Seamless Duplex:建模同步音频流,自然处理停顿、附和与打断
- Think-While-Speaking:在说话的同时并行执行私有推理,化解深度思考与低延迟的矛盾
- 内置 Voice Agent,可在不打断对话的情况下异步执行工具调用
成绩方面:推理模式下在 StepAudioChat 达 73.0 macro 平均分;MMSU 基准 90.6;Artificial Analysis Full-Duplex Bench 总分 98.9;τ-Voice 任务成功率 56.0%。对话与推理表现媲美专门的推理模型,同时保持实时说话能力。
所属事件:阶跃星辰发布 StepAudio 3 全栈音频模型家族(6 条相关)→
「模型」频道最新
- all-MiniLM-L6-v2 仍在热榜,作者劝你换新模型 — tomaarsen · 2026-09-16
- HF 研究员公开质疑 Claude 用量限额:月度耗尽周额度却剩 84% — NielsRogge · 2026-09-16
- Meta 承诺开源的 Muse Spark 权重逾期一月仍未发布 — RishiFurfox · 2026-09-16
- 李博杰:AI 擅长小步优化,但 taste 与系统设计仍难取代 — yangyi · 2026-09-16
- 首测 Jev 与验证过的 Gemini 3.5 Flash 工作流仅八成一致 — mayfer · 2026-09-16
- 新模型 Jev 靠快推理+结构化输出实时通关超级马里奥 — hardimanjames · 2026-09-16