VākQA:首个泰卢固语口语问答基准,揭示 LLM 评测的自动裁判缺陷
SPL-IIITH · hf · 2026-09-18
IIIT 斯里城团队发布 VākQA,一个面向泰卢固语口语事实型问答(SQA)的基准,包含 2,001 个事实问答对,覆盖六个领域,附带 2.53 小时语音音频、双语转写和人工核验的参考答案。
评测方法验证发现:Gemini-as-a-judge 最接近人类评分但宽严不一;开源权重裁判会系统性地惩罚与参考答案表层形式不同的正确泰卢固语答案。
基于此设置对专有与开源模型横评后,团队观察到:泰卢固语措辞保留翻译中丢失的文化特异性;语音输入引入音位混淆改变问题含义;ASR-MT 级联误差逐级放大。基准已公开发布。
「研究」频道最新
- Claude 优化 30+ 开源分子模型:平均提速 4 倍,GPU 时省 100 倍 — BenBlaiszik · 2026-09-18
- 实证研究拆解编码 Agent Harness:哪个组件真正有用 — HamedZamani · 2026-09-18
- Q-Planning 让机器人策略自我改进:Q 函数吃成败轨迹减少人工干预 — micoolcho · 2026-09-18
- 费城儿童医院用开源 AI 秒级建模儿童心脏,替代 6 小时手工建模 — nvidia · 2026-09-18
- 密歇根航天系视频展示:生成式 AI 用于气动设计与湍流控制 — ricardovinuesa · 2026-09-18
- 何恺明团队提出 ELF:连续嵌入空间扩散语言模型,少量步数超越离散 DLM — alec_helbling · 2026-09-18