llama.cpp 新增推理保留模式,但担心上下文爆炸
anderspitman · reddit · 2026-08-19
Reddit 用户讨论了 llama.cpp 中的 --reasoning-preserve 参数。
该参数会让 llama.cpp 在对话中包含完整的推理痕迹,而不仅仅是最终答案。这理论上能提高回答质量,但考虑到模型思考量巨大,用户担心这会迅速撑爆上下文窗口。
「Infra」频道最新
- 英伟达发布多 GPU 方案:分钟级运行大规模 UMAP — leland_mcinnes · 2026-08-19
- 澳洲电价午间跌至零,太空数据中心遇挑战 — aronchick · 2026-08-19
- 实测 DFlash2 加速 Qwen3.8 27B:代码提速至 200tk/s — Hefty_Wolverine_553 · 2026-08-19
- ZML 运行时支持 9 种硬件平台,包括 NVIDIA、AMD、国产摩尔线程 — ylecun · 2026-08-19
- Cerebras 举办上市后首会,称其芯片助 OpenAI 提速 — Scobleizer · 2026-08-19
- Genkit Go 1.12:扩容模型与优化错误 — rseroter · 2026-08-19