NOLLI 基准测试:精准诊断大模型英韩双语性能差异
HAERAE-HUB · hf · 2026-08-06
HAERAE-HUB 发布了 NOLLI,一个通过程序化生成的英韩双语解谜基准测试,旨在精准诊断大模型在韩语处理上的性能差距。该基准包含 15 种谜题类型(25 项任务,7500 个测试项),所有实例均可通过种子重新生成并验证唯一解。
NOLLI 通过行为校准难度,而非简单认为“越大越难”。其三级设计结合了直接翻译、基于韩文字母的脚本改编以及植根于韩国文化的纯韩语任务。对 15 个前沿、开源及韩国本土模型的评测显示:
- 在匹配的英韩任务中,准确率在统计上处于等效范围(±10个百分点),表明仅改变呈现语言带来的代价很小。
- 在密集使用文字系统的任务中差距显著:韩语密码比英语落后高达 68.7 个百分点。
- 模型规模大小在 15 种类型中有 7 种无法作为预测经验难度的可靠指标。
「研究」频道最新
- 深度学习预测疾病风险:全基因模型OGM引发学界讨论 — anshulkundaje · 2026-08-06
- 哈佛麻省理工推 MatrAIx:构建 83 亿数字分身评估 AI — BrihiJ · 2026-08-06
- 新神经网络架构 OGM 用于人类疾病风险预测 — anshulkundaje · 2026-08-06
- CoCoEvolve:打破模态壁垒的图表与代码一致性学习新框架 — Xuehang Guo · 2026-08-06
- Ego2Robot:将人类第一视角视频转为海量机器人训练数据 — Ye Wang · 2026-08-06
- 伯克利提出并行 GEPA 算法:提示词优化提速 4 倍且缓解过拟合 — berkeley_ai · 2026-08-06