Gemma 26B A4B 本地实测:一次过 C++ 编码测试,工具调用却频翻车

HyperWinX · reddit · 2026-09-20

用户在本地用 llama-server 跑 Unsloth 的 Gemma 26B A4B QAT Q4KXL 量化模型(搭配 Q40 MTP 投机解码、128K 上下文),发现它成为其测试集中首个一次性通过 C++ HTTP 服务器编写任务的小模型,5 分钟完成且实测可用。但在 Pi agent 中做工具调用时问题频出:提交计划失败、写文件时混淆或遗漏参数,上下文到约 30K 后愈发严重,且输出重复多。帖中附完整 llama-server 启动参数,并询问如何提升工具调用成功率。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →