双 RTX 3090 本地跑 256k 上下文模型,实战数月后求升级建议

knighty1981 · reddit · 2026-10-03

作者分享自己的本地 LLM 服务器配置:Supermicro SYS-4029GP-TRT 机箱(PCIe 3.0,可装 8 卡)、双 Xeon Gold 6230R、230GB 内存、2×RTX 3090 24GB,运行 huihui-27b 与 qwen3.8-27b 的 256k 上下文版本,通过 opencode 远程使用。

实际用途相当丰富:

踩坑经验:256k 上下文需多次压缩,agent 常用错 SSH 命令、改错设置需人工回退;作者反思应预先拆分小任务并让它先做规划。作者认为超过 256k 上下文会加剧幻觉和死循环。

升级疑问:再加 2 张 3090 拆分模型跑得更快,还是各卡跑不同模型组「AI 议会」?更大模型提升有多大?PCIe 3.0 会不会拖累多卡张量并行的性能?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →