TTS 语音指令评测怎么做?Inworld 评测负责人公开方法论
rdesh26 · x · 2026-09-26
Inworld 评测负责人 Aleksey Tikhonov 在博客详细分享其新模型 Realtime TTS-2 的「voice steering」评测难题与解法:模型可跟随自由格式的语音指令(如 [speak sadly]、[whisper softly],类似 Grok TTS、Gemini TTS、ElevenLabs v3),但音频裁判 LLM 在实测中不可靠,可引导的指令空间也无已知边界。
核心内容:
- 训练方案:不再用固定指令列表造数据,而是让模型泛化到训练中未见过的指令——实测有效
- 评测发现:LLM judge 帮助有限;指令措辞明显影响效果;不同音色的可引导性差异很大
- 他们为此设计了一套衡量「可引导性」整体水平与追踪改进的新评测方法
对做语音/多模态评测的团队是少见的一手经验分享。
「多模态」频道最新
- 曝 xAI 正为 Grok Imagine 开发 AI 音乐作曲功能(未证实) — nima_owji · 2026-09-26
- 用 KJnodes 搭 Krea 2 边界框工作流:画框写词控制出图 — Mulksky · 2026-09-26
- 一条 prompt 让 ChatGPT 给视频加上可交互 AR 眼镜特效 — chrisfirst · 2026-09-26
- Mirage 推出 Tesseract:让 AI Agent 直接编辑渲染专业视频 — chrisfirst · 2026-09-26
- Quiver Arrow 2 上线 Melius:提示词直出可编辑 SVG 矢量图 — stuffyokodraws · 2026-09-26
- 网友批评 AI 动画 demo 只是样条曲线与缓动的堆砌 — ryunuck · 2026-09-26