Kyutai 发布语音原生推理模型 Voice of Reason,GSM8K 达 77.1%
alexcovo_eth · x · 2026-09-22
Kyutai Labs 发布 Voice of Reason,一个语音原生(speech-native)推理模型:给它一个口头提问,无需转写文本、也不经过文本 LLM,直接用语音完成推理并用语音作答。
在 GSM8K 数学基准上,成绩从此前语音模型 GLM-4-Voice 的 27.3% 大幅提升至 77.1%。
「多模态」频道最新
- Freya 发布 Adam/Eve 语音模型,称已跨越恐怖谷 — ycombinator · 2026-09-22
- Reddit 求实测:开源 LongCat-Video 生成 10 秒视频各 GPU 要多久 — Clean_Extreme_3970 · 2026-09-22
- 北邮研究揭示视频扩散模型违反物理的根源:RoPE 注意力衰减锁死轨迹 — BUPT-CIST · 2026-09-22
- 腾讯 ARC 发布 WorldCrafter:隐式 3D 记忆让视频世界模型分钟级探索保持一致 — TencentARC · 2026-09-22
- Grok 4.7 在 Blender 里搞出创作,一段演示引发围观 — iamfakhrealam · 2026-09-22
- 24G 内存 MacBook 跑 Qwen-Image 本地生图:一张要 5-6 分钟 — vista8 · 2026-09-22