同一开源模型在自研引擎里思维循环崩坏,换 llama.cpp 即恢复正常

pand5461 · reddit · 2026-10-04

作者测试某热门推理引擎时,让 IQ32 量化模型回答「哪些现代开源模型谄媚感最弱」的问题,并借此测量长文本生成速度。结果模型的思考链在生成约 1 万 token 后陷入退化循环,反复输出「Need maybe maybe include...」式的碎片,无法收敛出答案。

关键对比:完全相同的模型换到 llama.cpp 中运行,则能正常生成连贯回答,没有出现 doom loop。结论直指问题出在该推理引擎本身而非模型,提醒大家遇到怪异行为时不妨先说一句「用 llama.cpp 试试」。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →