Jarvis Bench 把语音评测拆成两问:真人盲测揭示模型自然度短板

rohanpaul_ai · x · 2026-09-15

VoiceArena 发布对话式语音 Agent 基准 Jarvis Bench v0.5,试图回答一个疑问:为什么语音 Agent 演示惊艳、基准分数接近满分,但现实中很少有人真正与语音 Agent 对话。

其设计核心:

@rohanpaulai 点评这一拆分设计:在任务完成度上人类与模型已相当接近,但在自然度上差距仍然明显——同一个数字背后的含义因拆分而完全不同。

所属事件:VoiceArena 发布语音 Agent 基准 Jarvis Bench(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →