15.3万人偏好评分:DAI-S2S-ST 语音模型人类偏好榜单发布
rdesh26 · x · 2026-09-16
研究机构 David AI 发布 DAI-S2S-ST 单轮语音到语音(S2S)人类偏好榜单,基于 153,000 条比较式人类评分,覆盖 7 个模型、819 条录音提示与 12 个评价维度,共 283 名评分者。
核心主张:现有语音基准只测任务完成度,而未来人们每天与模型对话数小时,自然度、个性、共情等「想不想继续聊」的体验才是关键。初版结果显示,与主流 S2S 排行榜结论并不一致。
「模型」频道最新
- GPT-6 Astra 在药物发现基准拿下 68.7%,作者称是阶跃式提升 — KexinHuang5 · 2026-09-16
- Zero 不是助手:数学测验仅得 2.5%,创作者称其是全新物种 — maxsloef · 2026-09-16
- ChatGPT 能生成性感图像,却拒绝把图里的狼换成猫 — comFX87 · 2026-09-16
- 博主锐评扎克伯格的 Muse:设计糟糕但语调讨喜 — _AustinCalvert_ · 2026-09-16
- 病毒学研究者吐槽:Claude 层层拦截,DeepSeek 却一路放行 — Qwen30bEnjoyer · 2026-09-16
- 用户实测 ChatGPT 与 Gemini 处理数据:一个改结构一个编数字 — Exact-Wrangler-5163 · 2026-09-16