Kimi K3 is the first open 3T-class MoE: 2.8T params, 1M context, trailing only Fable 5 and GPT-5.6

Kimi K3: Open Frontier Intelligence

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan Cai, Peizhou Cao, Yuxuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Guanduo Chen, Guangyu Chen, Guanzheng Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kexin Chen, Peng Chen, Ruijue Chen, Wentao Chen, Xin Chen, Yang Chen, Yanru Chen, Yifei Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Dazhi Cheng, Yean Cheng, Jialei Cui, Jingbing Cui, Anqi Dai, Jiaqi Deng, Hao Ding, Rui Ding, Shaofeng Ding, Mengfan Dong, Mengnan Dong, Yuhao Dong, Yuxin Dong, Angang Du, Chenzhuang Du, Dikang Du, Jusen Du, Yulun Du, Yu Fan, Jing Feng, Qiulin Feng, Yichen Feng, Kelin Fu, Qiang Fu, Fuxuan Gao, Hongcheng Gao, Jingyue Gao, Tong Gao, Weijia Gao, Shangyi Geng, Jie Gong, Linhu Gong, Shengao Gong, Xiaochen Gong, Qizheng Gu, Yicheng Gu, Shuhao Guan, Haiqing Guo, Shiqi Guo, Xiang Guo, Zhengyan Guo, Beixi Hao, Wenxin Hao, Xiaoru Hao, Dailan He, Haotian He, Lehan He, Qi He, Weiran He, Xinran He, Xinyi He, Yibo He, Yunjia He, Chao Hong, Tiange Hong, Hao Hu, Jiaxi Hu, Ruikun Hu, Weiming Hu, Yangyang Hu, Zhenxing Hu, Liang Hua, Jinbin Huang, Ke Huang, Ruiyuan Huang, Siying Huang, Weixiao Huang, Yan Huang, Zhengjie Huang, Zhiqi Huang, Yulong Hui, Chaobo Jia, Yutong Jiang, Zhejun Jiang, Zuoyou Jiang, Wenyi Jin, Xinyi Jin, Yu Jing, Huanjun Kong, Guokun Lai, Aidi Li, Cheng Li, Chengyuan Li, Cong Li, Fang Li, Guanyu Li, Haoyang Li, Jia Li, Junxiong Li, Lei Li, Letian Li, Lincan Li, Weihong Li, Wentao Li, Xintong Li, Yang Li, Yishen Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Zhengxiao Li, Zhiyuan Li, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zichao Lin, Ziyan Lin, Bill Liu, Boxiao Liu, Chuan Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yipeng Liu, Zhengying Liu, Zhiheng Liu, Enzhe Lu, Haoyu Lu, Linqiang Lu, Tingzhan Lu, Zhiyuan Lu, Aotian Luo, G. Luo, Junyu Luo, Yifan Luo, B. Lyu, Wenzhou Lyu, Shaoguang Mao, Yuan Mei, Xin Men, Minqing Ni, Yixuan Niu, Siyuan Pan, Shujun Peng, Zhangyang Qi, Ruoyu Qin, ZeChao Qin, Zeyu Qin, Haiquan Qiu, Jianxin Qiu, Jiezhong Qiu, Bowen Qu, Yuhao Qu, Zeyu Shang, Youbo Shao, Han Shen, Jincheng Shi, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Wingchun Siu, Pengwei Song, Xiaoxi Song, Jianlin Su, Yunfeng Su, Zhaochen Su, Lin Sui, Jingsong Sun, Junyao Sun, Shaoning Sun, Shuzhe Sun, Tongyu Sun, Yujun Sun, Yunpeng Tai, Chuning Tang, Heyi Tang, Sirui Tang, Zecheng Tang, Chaoran Tian, Rongpeng Tian, Yu Tian, Wei Tu, Chensi Wang, Chuang Wang, Chunjie Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Hao Wang, Huaqing Wang, Hui Wang, Jiayi Wang, Jinglong Wang, Jinhong Wang, Jiuzheng Wang, Linian Wang, Shaobo Wang, Shenzhi Wang, Shuyi Wang, Si Wang, Siyuan Wang, Tianfu Wang, Wenjue Wang, Xingran Wang, Xinmei Wang, Xinyuan Wang, Xusheng Wang, Yalin Wang, Yangkun Wang, Yao Wang, Yaoyu Wang, Yejie Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhenhao Wang, Zhongsheng Wang, Zifan Wang, Chu Wei, Ming Wei, Shouxin Wei, Zichen Wen, Fan Wu, Haoning Wu, Rucong Wu, Wenhao Wu, Xiaoxue Wu, Yingcong Wu, Yongqi Wu, Yuxin Wu, Zijian Wu, Xinglang Xian, Chenxuan Xiang, Yuye Xiang, Bocheng Xiao, Chenjun Xiao, Xin Xiao, Jin Xie, Xiaotong Xie, Yifeng Xie, Zhe Xie, Bowei Xing, Yiming Xiong, Baosheng Xu, Boyu Xu, Jiale Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Qingtao Xu, Shuyao Xu, Suting Xu, Tiantian Xu, Tianxiang Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ye Xu, Yueni Xu, Ziyao Xu, Haonan Xue, Junjie Yan, Yaoyao Yan, Fan Yang, Guangyao Yang, Hao Yang, Junwei Yang, Ruoyu Yang, Wenjie Yang, Xiaofei Yang, Xinyu Yang, Yi Yang, Yiling Yang, Ying Yang, Yuchen Yang, Zhen Yang, Zhilin Yang, Zian Yang, Zuhao Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhanbo Ye, Bohong Yin, Haoxiang Yin, Xietong Yin, Chengzhen Yu, Haozhen Yu, Longhui Yu, Shengnan Yu, Shuying Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Tongtian Yue, Wei Yue, Yang Yue, Dunyuan Zha, Haobing Zhan, B. H. Zhang, Dehao Zhang, Fei Zhang, Hao Zhang, Haoyuan Zhang, Huanyu Zhang, Jiapei Zhang, Jiaxuan Zhang, Jin Zhang, Kaiyi Zhang, Miaozhen Zhang, Puqi Zhang, Qinglei Zhang, Rong Zhang, Rui Zhang, Shaoshuai Zhang, Shiyi Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yangkun Zhang, Ye Zhang, Yichi Zhang, Yikun Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Zijing Zhang, Bin Zhao, Chenguang Zhao, Feifan Zhao, Jinglun Zhao, Jinxiang Zhao, Shuai Zhao, Wenshuo Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Haozhi Zheng, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Haofeng Zhong, Lei Zhong, Longguang Zhong, M. Zhou, Qiankang Zhou, Runjie Zhou, Ruozhang Zhou, Xinyu Zhou, Yiqiao Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yangjunfeng Zhu, Yuxuan Zhu, Zhen Zhu, Chen Zhuang, Weiyu Zhuang, Xinxing Zu

cs.CL, cs.LG

2026-07-28

Kimi K3 is a 2.8T, 104B-activated open MoE with 1M context and about 2.5x the scaling efficiency of K2, trailing only Fable 5 and GPT-5.6 Sol across 40+ benchmarks at a fraction of flagship cost.

What problem this solves

Open models have advanced fast on the test-time-scaling axis (reasoning, RL, long-horizon agents) but have largely stalled on pre-training scale, with most sitting at or just above 1T parameters. As reasoning methods pile onto foundations of similar size, the gap to the strongest proprietary systems widens. Kimi K3 pushes both axes at once: a 3T-class pre-trained foundation plus RL, reasoning effort, and long-horizon interaction at 1M context.

Method

K3 is a native multimodal MoE: 2.8T total parameters, 104B activated per token, 1M context. The architecture scales information flow along three dimensions. Along the sequence, hybrid attention pairs three Kimi Delta Attention (KDA) layers with one Gated MLA layer per block for efficient long-context mixing while keeping global interaction. Along depth, Attention Residuals let each layer reach past the usual sequential residual to selectively attend to any earlier layer. Along width, Stable LatentMoE expands to 896 routed experts with 16 active per token, stabilized at extreme sparsity by normalization, the SiTU-GLU activation, and Quantile Balancing. The vision encoder MoonViT-V2 is trained from scratch with next-token prediction.

Against K2 (1.04T total, 32.6B activated, 128K context, MLA), K3 scales layers 61 to 93, activated parameters 32.6B to 104.2B, experts 384 to 896, context 128K to 1M. Scaling-law studies bundle these changes with data and recipe tweaks and report roughly a 2.5x gain in overall scaling efficiency, meaning the compute for a given validation loss falls to about 40%.

Post-training targets 1M-context test-time scaling: RL across long-horizon coding, general agents, reasoning, and knowledge at multiple reasoning-effort levels, in environments spanning verifiable search, software engineering, kernel optimization, vision tool use, persistent assistants, web development, and autonomous execution, often with hundreds or thousands of tool calls per episode. Domain- and effort-specialized policies are consolidated into one model via multi-teacher on-policy distillation.

Results

Across 40-plus benchmarks against Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, and GLM-5.2 (K3 at max effort), K3 trails Fable 5 and GPT-5.6 Sol overall while consistently leading the rest. Selected results:

BenchmarkKimi K3Claude Fable 5GPT-5.6 Sol
GPQA Diamond93.592.694.1
SWE-Marathon (GPU kernel)42.035.039.0
FrontierSWE81.286.671.3
BrowseComp91.288.090.4
MCPMark-Verified94.587.492.9

Research-grade reasoning is the weak spot: CritPt only 23.4% (Fable 5 28.6, GPT-5.6 32.3), HLE-Full with tools 56.0% (Fable 5 63.0). On third-party leaderboards, Intelligence Index v4.1 ranks 4/580 (57.1), Vals Index 2/39 (74.7), WebDev Arena Elo 1/99 (1678). On cost, BrowseComp scores 91.2 at $2.03 per task, about half of GPT-5.6 Sol (90.4) and an order of magnitude cheaper than Claude's flagships.

Why it matters

This is the first open-weight 3T-class model. The open ecosystem has lacked a base that can go toe to toe with proprietary flagships on scale; by pushing parameters, activation, and context up at once, K3 lands near the flagships and well ahead of other open models across coding, agents, knowledge, and vision, at a fraction of the inference cost. For self-hosters and agent builders it is a real base or reference option, with fully open weights.

Limitations

The authors concede that research-grade reasoning (CritPt, HLE) trails Fable 5 and GPT-5.6 Sol, and that Elo-rated knowledge-work suites (GDPval-AA v2, AA-Briefcase) are led by Fable 5. Cross-model comparison is not fully clean: Fable 5 results include fallbacks, GPT-5.6 Sol includes cyberguards, and models run under different harnesses (Kimi Code, Claude Code, Codex) to which scores are sensitive. Elo scores drift as matches accumulate. Running a 2.8T model at 1M context is a serious deployment hurdle, which the long infrastructure section tacitly acknowledges.

Terms

Source

What people are saying

Related papers

All paper explainers