Reddit 反馈 GLM-5.2 在 32k 到 64k 上下文后崩溃
naunen · reddit · 2026-07-26
一位 Reddit 用户反馈,GLM-5.2 在一套混合 CPU/GPU 环境里跑 8k 上下文很稳定,但只要上下文拉到大约 32k–64k 以上,生成就会在第一个 token 直接崩掉。
报错表现是 llama-sampling.cpp 里所有 logit 都变成 NaN。帖主已经尝试了开关 DSA、开关 flash attention、把 batch 缩小、把 KV cache 挪到 CPU、切换 KV 精度,以及拉取最新的 GLM-DSA 索引器修复,问题都没解决。他怀疑是 GPU 侧 DSA/indexer 路径里的 FP16 溢出,并询问是否有已知 workaround。
「模型」频道最新
- 对比帖称 Fable 5 比 Opus 5 更快也更便宜 — bindureddy · 2026-07-26
- 递归研究智能体 AREX 4B 版本据称胜过 Qwen3.5-35B — imjustnewatai · 2026-07-26
- 对比 Google TPU、Gemini 与 xAI 的 10T 训练说法 — imjustnewatai · 2026-07-26
- Meta 和阿姆斯特丹大学改进离散 Flow Matching 生成 — burkov · 2026-07-26
- Model Zen Garden 把盲测做成 3D 模型排行花园 — gajesh · 2026-07-26
- 有人在测 5.6 Sol Pro 的人口伦理提示词是否真有新意 — AaronBergman18 · 2026-07-26