NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap
Dasol Choi, Joonyong Park, Daegon Yu, Soo Yong Kim, Youngsook Song, Seunghyeok Hong
cs.CL
2026-08-05
程序生成的英韩谜题基准(15 类、7500 题)测 15 个模型:匹配的直接翻译下英韩几乎等价(±10pp 内),差距集中在韩语密码这类要对子音字母做多步操作的题(最多落后 68.7pp)。
当一个大模型在韩语上比英语差,到底差在哪?现有的多语言评测通常只给一个笼统的「韩语比英语低 X 分」,把语言本身、文字系统、韩语特有知识这几种失败混在一起。静态基准还容易被污染、被刷到饱和,而且难度往往按题目结构(格子多大、链条多长)来定,不一定和模型实际感受到的难度对得上。
NOLLI 想做的是诊断,不是排名。它用程序生成的英韩对照谜题,把「换语言呈现」「换文字系统」「换韩语特有知识」三种影响拆开,让每种都能单独看。
NOLLI 有 15 类谜题、25 个任务、7500 道题,每一道都由任务专属的生成器按随机种子产出,可复现、有唯一解、用确定性判分(全程不用 LLM 当裁判)。
最关键的是难度标定。作者不靠题目大小定义「难」,改按模型行为来定:对每类谜题,调生成器参数,直到一个固定的参考模型(Gemini 3 Flash,中等推理强度)落在目标准确率区间里,Easy 是 75±10%、Medium 50±10%、Hard 25±10%。这样三档难度是「让模型做到这个分」标出来的,不是拍脑袋。75 个任务-难度组合里 72 个落进区间。
三层的跨语言设计是诊断的核心。第一层是直接翻译(8 类谜题,英韩同参数同生成器,模板手写、不走机器翻译),这一层专门估「换个语言呈现」本身要付多大代价。第二层是文字系统改编(Cipher 密码、Cryptarithmetic 算式),英韩都有,但韩语版按谚文字母(jamo,即韩语音节块拆出来的子音字母)的组合结构改造。第三层是韩语独有(5 类:亲属称谓、四柱、时间、韩语度量、字母组合),没有英语对应。
jamo 是关键概念:一个韩语音节块拆成初声、中声、(可选)终声。韩语密码要在 jamo 上做索引运算;字母组合题要把音节拆开再拼回。
作者测了 15 个模型,包括前沿的 GPT-5.5、Claude Opus 4.8、Gemini 3.1,开源的 Llama、Qwen、Gemma、DeepSeek,以及韩语自研的 EXAONE、Mi:dm、Solar。三个整体准确率低于 3% 的(地基太差)排除,差距分析在剩下 12 个上做。
第一层的结论很干净:匹配的直接翻译下,英韩准确率差距只有 −2.7 到 +5.0 个百分点,统计上等价(±10pp 的容差,TOST 检验通过)。也就是说,单纯把题目换成韩语呈现,几乎不扣分。
差距集中在文字系统层。韩语密码(Korean Cipher)比英语最多落后 68.7 个百分点:DeepSeek-V4-Flash 英语 74.3%、韩语 5.7%。每个英语还能做一点的非前沿模型,韩语至少掉 21 个点;Qwen3.5-27B、EXAONE-4.0、Solar-100B、gpt-oss-120b 英语还有 21% 到 56%,韩语直接跌破 1%。
反差在隔壁那道题上。同样是 jamo,Cryptarithmetic(把 jamo 当不透明符号做字母算式)韩语几乎不吃亏,12 个模型里 6 个韩语反而更高。密码要拆音节、做索引运算、再拼回去;算式只把 jamo 当符号映射。所以问题不在「分词器处理不了 jamo」,在「对 jamo 做多步链式操作」。
| 任务类型 | 操作 | 韩语表现 |
| 直接翻译(8 类) | 同题换语言呈现 | 与英语等价(±10pp) |
| Cryptarithmetic | jamo 当不透明符号 | 无系统性劣势 |
| 韩语密码 | 拆音节→索引运算→拼回 | 最多落后英语 68.7pp |
两条证据闭环。一是字母组合题(Jamo Composition)的准确率能预测韩语密码的准确率,R²=0.91,控制住直接翻译的韩语分后偏相关还有 0.87;二是错误分析里,强模型即便解错也能恢复大半 jamo(相似度 0.85+),弱模型停在基线水平(0.11 到 0.21),而「把对的 jamo 序列错位一位」这种干净的单步失误几乎为零,说明垮掉的是多步链条不是单步。
韩语独有的亲属题暴露了另一类缺口:12 个模型全部为正,而且不随整体变强而缩小(r=0.16)。前沿组内部甚至反过来,Gemini 3.1(69.0)> Opus 4.8(63.3)> GPT-5.5(45.7);整体最强的 GPT-5.5 亲属题亏得最多(−36.7pp)。
最后是个方法论警告:一个显眼的「题目规模」指标,在 15 类里有 7 类从 Easy 到 Hard 并不增长。比如亲属题链长从 4 到 5 跳(易)缩到 2 到 3 跳(难),参考模型准确率却从 77% 掉到 31%。拿结构规模当难度的代理,靠不住。
对做评测和多语言模型的人来说,NOLLI 给了个能反复用、不怕污染的诊断工具,而且把一句「韩语差」拆成了可定位的三件事。最重要的实操结论是:韩语掉分的主因是模型对子音字母做多步操作的能力跟不上,不在分词器处理 jamo。这意味着把分词器调细未必够,得让模型在训练里真正练过多步的字母级操作。
「按模型行为标定难度」这套做法也值得借:与其假设格子越大越难,不如让参考模型告诉你哪档参数对应哪档难度。
作者自己说得很清楚:这些对比是诊断性的、不是因果性的。文字系统改编和韩语独有的题,在任务内容、程序需求上和直接翻译不同,所以只能「定位候选瓶颈」,不能断言它就是原因。
具体到子音字母这条,相关只覆盖 12 个模型,而且字母组合和密码都操作 jamo;没有测每个模型实际的 jamo 合并方式,也没有英语字符级的对照,所以分不出「这是韩语特有的瓶颈」还是「通用的子词操作弱」。韩语独有的题和直接翻译基线在任务族、答案空间、上下文长度上都不一样,而亲属题是唯一的文化词汇任务,泛化到更广的韩语文化知识要打折扣。
难度标定只针对一个参考模型(Gemini 3 Flash)的一个推理强度,绝对档位未必能迁到别的模型;作者在 6 类上做了留出复测,20 个格里 20 个保序、多数保档,但全套稳定性还没验。等价性也是相对 ±10pp 容差说的,不等于英韩准确率一样。