Gemma 4 31B Q8 突然在 68k 上下文报显存共享超限错误
Few_Professional6859 · reddit · 2026-09-26
作者报告:Gemma 4 31B 的 UD-Q8KXL 量化版在同一台机器、同样配置下原本可以在 68k 上下文长度正常加载运行,如今却突然报「Exceeds shared memory」错误。同设置曾稳定工作,说明问题可能出在运行时/驱动层更新而非模型或硬件本身,附有报错截图。对本地长上下文推理用户是值得留意的回归性 bug。
「Infra」频道最新
- 谷歌 150 亿美元印度数据中心项目遭村民抗议,土地承诺落空 — nordicinst · 2026-09-26
- DeepSeek-V4.1-Flash 跨 M5 Ultra 与双 RTX PRO 6000 分层运行 — harrythunder · 2026-09-26
- Nvidia SoL-Pi 优化 agent 控制层,编码 token 用量最多省 49% — The Decoder · 2026-09-26
- 6 张 3090 跑 Qwen3.8 本地部署实测:80-120 tokens/s — takoulseum · 2026-09-26
- Meta 开源 30B 本地智能体模型 Muse Glimmer,17GB 量化跑进 24GB 单卡 — bibryam · 2026-09-26
- 数千亿美元数据中心 GPU 两三年后过时了怎么办? — No-Papaya-9289 · 2026-09-26