LG 开源 750B/37B 大模型:长检索与安全领先,数学常识仍追不上前沿

K-EXAONE 2.0 Technical Report

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon

cs.CL

2026-08-05

K-EXAONE 2.0 是 LG 的 750B/37B 开源 MoE(从 K-EXAONE 升参而来),256K 上下文、十语种;相对前代 24 项基准平均升一成、三个编程基准升约三成,长检索与安全领先同类开源,数学和世界知识仍落后 GLM-5.1 等。

这篇在解决什么

这是一篇技术报告,记录 LG AI Research 把自家的 K-EXAONE 从 236B/23B 的 MoE 扩到 750B/37B,目标是「朝全球前沿规模的基础模型迈进」。K-EXAONE 是一个在韩国自主算力项目支持下做出来的「主权」基础模型,定位是把训练数据、安全标准这些关键能力握在自己手里。

报告的主线不是「我们第一」,作者在结论里直言「K-EXAONE 2.0 并非在每个基准上都领先」。它要回答的是:把容量放大三倍多之后,能力到底落在哪里、还差在哪。

方法

模型没有从零训,而是「升参」(upcycling)自 K-EXAONE:深度从 48 层加到 78 层(2 层 dense 加 76 层 MoE),每层专家从 128 个加到 256 个,每 token 路由 top-8 外加 1 个共享专家。注意力沿用混合方案(滑动窗口 128 加周期性全局层)以扛长上下文。一个有意思的稳定化细节:最后 16 层用「Clamped SwiGLU」把激活值钳在阈值 7.0,作者说不然最后一层激活会冲到 6862,FP8 训练和服务都顶不住。

上下文扩到 256K,靠两段中期训练(各 400B token,先 64K 后 256K)。在此基础上又做了 8T token 的持续预训练,数据里加了两种新合成方法:Active Reading(造参数化知识)和带「latent thoughts」隐式中间推理的预训练。

后训练分几步:350B token 的 SFT(刻意冻结路由参数以保住专家专长),两阶段偏好学习(先用 GROU PER 这个组内方法做多任务偏好,再做带安全感知的偏好,管拒答、抗越狱、对答不出的题主动放弃),并保留了 agentic 场景下跨轮的思维链。推理加速给了两个投机解码 draft 头,其中 DSpark(半自回归块扩散)端到端提速 1.81 到 2.57 倍,胜过联合训练的 MTP 头(1.27 到 1.77 倍)。

结果

24 个基准、9 个类别,全部报的是推理模式分数。相对前代 K-EXAONE,平均升一成多,最亮眼的几项集中在编程和长上下文。

基准K-EXAONEK-EXAONE 2.0提升
SWE-BENCH VERIFIED(编程)49.468.2+18.8
TERMINAL-BENCH 2.1(agentic)30.343.8+13.5
OPENAI-MRCR(长上下文检索)52.394.4+42.1
POLYMATH(多语推理)57.471.3+13.9
GPQA-DIAMOND(知识)79.182.2+3.1

编程上三个基准升约三成。长上下文检索是最大的单项跃升(OPENAI-MRCR 52.3 到 94.4),作者说 256K 范围内的 needle-in-a-haystack 全位置满分检索。

横向比同类开源 MoE(Qwen3.5 397B/17B、GLM-5.1 754B/40B、DeepSeek V4 Pro 1.6T/49B),K-EXAONE 2.0 在两块领先:长上下文检索(OPENAI-MRCR 94.4,高于 Qwen3.5 的 93.0 和 GLM-5.1 的 71.5)和安全。安全这一块是报告反复强调的差异化:KGC-SAFETY 99.8、ROK-FORTRESS 89.5,都高于所有列出的对手;K-AUT-V2 这个内部安全分类把风险类目从 226 扩到 296。

但也明显落后。世界知识和数学上,GLM-5.1 和 DeepSeek V4 Pro 普遍更高:GPQA-DIAMOND 82.2 对 GLM 的 90.1,AIME 2026 是 92.3 对 95.3,HLE(Humanity's Last Exam)只有 18.3,被 DeepSeek V4 Pro 的 28.7 和 GLM-5.1 的 37.7 甩开一截。报告从头到尾没和 GPT、Claude、Gemini 这些闭源前沿直接打分,「全球前沿」是个愿景,不是测出来的结论。

为什么重要

对想要一个可控、可本地部署的超大开源模型的人来说,K-EXAONE 2.0 是少数 750B 级、Apache 2.0、带 256K 上下文的选项,且在长文档检索和安全对齐这两块比同体量开源对手强。它的价值不在于刷最高分,而在于把一条「主权」路线走通了:扩容、扩长上下文、扩安全,全部自报、全部开源。

报告里的工程细节对做大模型训练的人有参考价值:Clamped SwiGLU 这种针对深层激活爆炸的稳定性修补、升参而非从零训、冻结路由的 SFT,都是实操中真踩过坑才会写的。

局限与存疑

最要紧的是:所有 K-EXAONE 2.0 的分数都是 LG 自报,没有第三方评测。其中 KGC-SAFETY 和 KO-LONGBENCH 是 LG 自建的基准,等于拿自己出的卷子考自己,99.8 的安全分要打折扣看;ROK-FORTRESS 虽是外部发布,但它是韩国语境的安全基准,韩国训练的模型天然占优。对手分数里有标星号的是直接取各家官方技术报告或榜单,口径不一,严格说不可比。

作者自己列的局限是大模型通病:可能生成不当或带偏见的内容、依赖训练数据统计、不含最新信息。结论那句「不在每个基准上都领先」是诚实的:世界知识和数学离最大号的开源对手还有距离,而且从未和闭源前沿正面比过。所以「全球前沿规模」目前更接近目标,不是已经到达的位置。

术语

原文与代码

相关论文

全部论文解读