Jarvis Bench 把语音评测拆成两问:真人盲测揭示模型自然度短板
rohanpaul_ai · x · 2026-09-15
VoiceArena 发布对话式语音 Agent 基准 Jarvis Bench v0.5,试图回答一个疑问:为什么语音 Agent 演示惊艳、基准分数接近满分,但现实中很少有人真正与语音 Agent 对话。
其设计核心:
- 由真人与语音 Agent 实时对话,而非离线评测;
- 第二组真人盲测两两投票,分别回答「哪个更像人(Naturalness)」和「哪个把事办成了(Task Completion)」;
- 排行榜里混入了一名真人作为隐藏对照。
@rohanpaulai 点评这一拆分设计:在任务完成度上人类与模型已相当接近,但在自然度上差距仍然明显——同一个数字背后的含义因拆分而完全不同。
所属事件:VoiceArena 发布语音 Agent 基准 Jarvis Bench(2 条相关)→
「研究」频道最新
- BVB 基准:让 agent 用 Blender 重建 288 段真实视频检验理解力 — SonglinYang4 · 2026-09-15
- 斯坦福生物工程系招聘终身轨教职,9月30日截止申请 — anshulkundaje · 2026-09-15
- 陶哲轩发起的反 Galois 问题 AI 挑战赛完成第一阶段 — tak3sh8 · 2026-09-15
- 单张 H100 四小时从零训练,ARC-AGI-1 拿下 76% — GregKamradt · 2026-09-15
- 首个免架构假设的神经网络密码分析提取攻击 — chaumian · 2026-09-15
- 投毒样本怎么选决定一切:LLM 后门攻击成功率可从 3% 到 80% — chaumian · 2026-09-15