PrismML Bonsai 27B 三值量化在 RX 9070 XT 上跑起真实工具调用
blakok14 · reddit · 2026-07-29
一位 Reddit 用户在 RX 9070 XT 16GB 上,用 llama.cpp 测试了 PrismML Bonsai 27B 的 ternary 量化版本,重点不是跑基准,而是在真实的工具调用流程里做结构化代码修改。
结论大致是:
- 对一个压缩到约 1.7 bits/weight 的模型来说,它的推理表现比预期更好。
- 在 agentic workflow 里,工具调用是能工作的。
- 但过程中仍出现了不少语法错误,作者明确表示还不敢把它当成可无人值守的方案。
即便如此,他仍把这件事看成一个里程碑:在这么激进的压缩下,模型还能维持 262K 上下文,并在真实 tool-calling 循环中跑起来。
作者最后也在征集 AMD/RDNA 平台上的实际 token 速度数据。
「编程与Agent」频道最新
- Kimi K3 通过 Responses API 可接入 Kimi Code 和 Claude Code — zainhas · 2026-07-29
- Figma 与 Sentry MCP 把设计和错误数据直接喂给编码 Agent — heypearlai · 2026-07-29
- GitHub MCP Server 与 Context7 成为编码 Agent 核心工具 — heypearlai · 2026-07-29
- 删掉一半 MCP 服务器,agent 可能立刻更聪明 — heypearlai · 2026-07-29
- Alexey Grigorev 的 AI 开发课覆盖规格、测试、Docker 和 CI/CD — Al_Grigor · 2026-07-29
- AI 编程代理正在消解开发者的心流状态 — bendee983 · 2026-07-29