Reddit 反馈 GLM-5.2 在 32k 到 64k 上下文后崩溃

naunen · reddit · 2026-07-26

一位 Reddit 用户反馈,GLM-5.2 在一套混合 CPU/GPU 环境里跑 8k 上下文很稳定,但只要上下文拉到大约 32k–64k 以上,生成就会在第一个 token 直接崩掉。

报错表现是 llama-sampling.cpp 里所有 logit 都变成 NaN。帖主已经尝试了开关 DSA、开关 flash attention、把 batch 缩小、把 KV cache 挪到 CPU、切换 KV 精度,以及拉取最新的 GLM-DSA 索引器修复,问题都没解决。他怀疑是 GPU 侧 DSA/indexer 路径里的 FP16 溢出,并询问是否有已知 workaround。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →