NOLLI 基准测试:精准诊断大模型英韩双语性能差异

HAERAE-HUB · hf · 2026-08-06

HAERAE-HUB 发布了 NOLLI,一个通过程序化生成的英韩双语解谜基准测试,旨在精准诊断大模型在韩语处理上的性能差距。该基准包含 15 种谜题类型(25 项任务,7500 个测试项),所有实例均可通过种子重新生成并验证唯一解。

NOLLI 通过行为校准难度,而非简单认为“越大越难”。其三级设计结合了直接翻译、基于韩文字母的脚本改编以及植根于韩国文化的纯韩语任务。对 15 个前沿、开源及韩国本土模型的评测显示:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →