求助:寻找原生支持64k上下文的本地 GGUF 模型
Inner-End7733 · reddit · 2026-07-31
一位开发者在尝试将 Hermes Agent 完全本地化部署到低配设备(64GB 内存 + RTX 3060)时遇到了上下文瓶颈。
面临问题:
- 主力运行 Qwen 3.5 35B 的量化版本,CPU 模式下速度尚可(30 t/s)。
- 但在配置用于上下文压缩的辅助模型时遇到了障碍:Hermes Agent 硬编码了 64k 的上下文请求。
- 如果 GGUF 模型的原生训练上下文(nctxtrain)小于 64k,即使使用 RoPE 扩展或强行设置参数,llama.cpp 也会直接拒绝任务。
需求:
寻找一个原生支持 64k+ 上下文、非推理型、且已有 GGUF 量化版本的密集模型,以满足本地 Agent 工作流的硬性要求。
「编程与Agent」频道最新
- 观点:应将大模型用作智能层而非文本输出工具 — braelyn_ai · 2026-07-31
- Devin 宣布原生支持 GitHub Stacked PRs — marlene_zw · 2026-07-31
- Claude 接入 Higgsfield MCP,一句话调用 30+ 视频模型 — dr_cintas · 2026-07-31
- GitHub 推出堆叠式 PR:大型代码变更拆分审查 — DanWahlin · 2026-07-31
- 开发者吐槽:AI Agent 总爱越权读取无关文件 — BLUECOW009 · 2026-07-31
- GitHub 正式推出 Stacked PRs 公开预览 — DanWahlin · 2026-07-31