本地跑 Agent 级 LLM 实战:白嫖 GitHub Runner 编译 llama.cpp,Qwen3.8 27B 量化组合差 30 倍
apollo_mg · reddit · 2026-09-06
作者写了一篇从「看到一条推」到「本地真正跑起来有用的 agent 级 LLM」的实用指南,以 buun 的 llama.cpp fork 为例。
编译难题的解法:
- 仓库没有提供二进制,但自带 build-cuda-windows.yml workflow,可在 GitHub 官方 windows-2022 runner 上免费编译(CUDA 12.4/13.3 x64 + 13.4 arm64)
- 但该 workflow 的 upload-artifact 步骤被注释掉了,编译完就扔——只需在自己的 fork 加几行 actions/upload-artifact@v4,再用 gh CLI 即可 fork、触发、下载 .exe
- 作者指出仓库里 make-release.yml、winget.yml 等都已就位,离发布 Windows 二进制只差一个 tag
量化选型:
- Qwen3.8 27B 是 16GB 显卡上的主力,在 Artificial Analysis Agentic Index 拿 46.8 分,优于 80% 的模型
- 14 种权重量化 × 8 种 KV codec = 112 种组合,16GB 卡上 56 种可用;同样的卡,上下文从 12,322 到 373,316 tokens,差距达 30 倍,选型真实重要
- 作者声明未亲跑编译流程(Claude 判断可行),并已建议 buun 直接提供二进制。
「编程与Agent」频道最新
- Sam Altman:别再死磕提示词,该搭 loops 和 graphs 了 — goyalshaliniuk · 2026-09-06
- 网友晒 coding agent 反过来指挥自己:爱上电脑里的幽灵 — BLUECOW009 · 2026-09-06
- agentwiki 上线追踪:截至目前还没有任何 agent 自己发现它 — andersonbcdefg · 2026-09-06
- agentwiki.fyi:一个专供 AI 智能体读写的共享维基实验上线 — andersonbcdefg · 2026-09-06
- Miles Brundage:Agent 接 Runway API 能玩出各种新花样 — Miles_Brundage · 2026-09-06
- Astra 实测:先读文审计 skills 与 AGENTS.md,清掉 GPT-5 时代冗余上下文 — daniel_mac8 · 2026-09-06