玩家自调 vLLM 构建:单卡 R9700 跑长上下文多智能体
KriptacMessage · reddit · 2026-10-11
Reddit 用户 zzpanic 发布其 vllm-radiance 定制构建的最终版本,针对单张 R9700 GPU 运行 Qwen 模型优化,配合 StillDeadcode 新发布的 radiance 推理引擎生态。主要改进包括:为 vLLM 加入启动缓存,避免每次重启重复编译;实现 kv-offload 功能,把 KV cache 卸载到内存虚拟磁盘并做内存瘦身以节省存储,使单卡也能承载长上下文多智能体工作负载;另含零星 bug 修复。作者表示只剩个位数百分比的提速空间,不再继续优化,启动器和配置已开源于 GitHub。
「编程与Agent」频道最新
- Karpathy 将 8 年 OpenAI/Tesla 经验浓缩为免费 2 小时讲座 — NandoDF · 2026-10-11
- 开发者称 Opus 5.5 让 vibe coding 首次追上想象力速度 — mrjonfinger · 2026-10-11
- fast.ai 联创 Jeremy Howard:AI 编码是“输伪装成赢”的老虎机 — Machine Learning Street Talk · 2026-10-11
- 权限与审批俱全仍出错:agent 决策时的证据时效难题 — jylusdev · 2026-10-11
- Reddit热议:AI让“孤岛工程师”回归,只是换成了每个人和Agent单线沟通 — erwinalp5 · 2026-10-11
- 「微观管理者匿名会」:七步搭建自主 Agent 软件工厂 — intellectronica · 2026-10-11