PrismML Bonsai 27B 三值量化在 RX 9070 XT 上跑起真实工具调用

blakok14 · reddit · 2026-07-29

一位 Reddit 用户在 RX 9070 XT 16GB 上,用 llama.cpp 测试了 PrismML Bonsai 27B 的 ternary 量化版本,重点不是跑基准,而是在真实的工具调用流程里做结构化代码修改。

结论大致是:

即便如此,他仍把这件事看成一个里程碑:在这么激进的压缩下,模型还能维持 262K 上下文,并在真实 tool-calling 循环中跑起来。

作者最后也在征集 AMD/RDNA 平台上的实际 token 速度数据。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →