实测后弃用 tree-sitter:本地 LLM 基准项目里的四个 Rust 决策
SprayPuzzleheaded533 · reddit · 2026-09-24
作者开发了一个本地 LLM 桌面基准工具(Tauri + Rust 后端、React 前端),分享了几个用数据说话的工程决策:
- 解析器选型实测:需要判断模型输出的 Python 是否语法合法。在 8 个真实小模型输出上对比 tree-sitter 与 rustpython-parser:tree-sitter 为容错设计,会把冒号后缺失的缩进静默拆成两条语句;rustpython-parser 则像 CPython 一样报错——而缺缩进正是小模型最常犯的错,于是完全移除 tree-sitter 依赖。
- Ollama 隐形坑:/api/generate 的 options 只认 snakecase(如 numctx、numgpu),其他键被静默丢弃,camelCase 拼写错误不报错、只是退回默认行为。作者踩坑后专门写了回归测试。
- KV cache 公式实测校验:用架构元数据(层数、kvheads、headdim)推算每 token KV cache 大小,与 Ollama 在 8192→16384 上下文下报告的实际显存增量对比,误差约 5%(分配取整),确认公式可信。
- NVML 采样独立线程:按 prompt 记录峰值功耗,无 NVIDIA 卡时返回 "unavailable" 而非报错,避免缺硬件的贡献者构建失败。
项目源码 MIT 开源:github.com/AnonBOTpl/LLM-Benchmark。
「编程与Agent」频道最新
- 神秘新模型 Space Bunny 免费一周:单 prompt 生成完整 60fps 游戏 — iamfakhrealam · 2026-09-24
- Depthfirst 用 agent 追踪依赖可达性,召回与精度大幅超越传统方案 — andreamichi · 2026-09-24
- 开发者发布免配置 GSC MCP 服务器,踩坑 GSC 数据陷阱 — StatisticianFormal44 · 2026-09-24
- GPT-6 编码代理退步:不懂切分支,只会克隆整个仓库 — banteg · 2026-09-24
- Together 发布 Jev 风格 4B 分类器,教你 17 美元微调自己的版本 — usamawahabkhan · 2026-09-24
- 开源工具 bough 可视化 Claude Code 任务耗时与 token 花费 — VoidEqualZero · 2026-09-24