免费 Kaggle T4 微调 Qwen 1.5B:审查代码不再编造 bug
jeeva1398 · reddit · 2026-10-06
开发者为离线 Node.js 代码审查微调了 Qwen2.5-Coder-1.5B,并以 npm 包发布。
- 训练:QLoRA(Unsloth,r=16,2 epochs,responses-only loss),Q4KM 量化后 986MB,在免费 Kaggle T4 上约 9 分钟训完。
- 数据:约 740 条自建样本,含 68 种真实崩溃类型的堆栈解析、74 个 before/after diff 审查场景(一半是干净 diff,教模型说「无问题」)、npm audit 报告。
- 效果:9 个干净 diff 上,基座模型全部编造问题,微调后 0 误报;8 个含 bug diff 中,基座检出真实率 48% vs 微调后 100%;CPU 推理快约 2 倍(5.9s vs 13.6s);不再编造包版本(93%→100%)。弱项:未见过的错误类型解释准确率 68%,低于基座 75%。
- 部署:CLI 可用 Ollama 或自带 node-llama-cpp(GGUF 带 SHA-256 校验),同一 CLI 可作为 GitHub Action 在纯 CPU runner 上审查 PR,模型跨运行缓存。作者坦诚评测规模小,并指出静态检查才是找 bug 主力,微调的职责是不瞎编并写修复。
「编程与Agent」频道最新
- 决策式评分器替代 LLM Judge,便宜32倍快8倍,一致率94% — rhythmrg · 2026-10-06
- Grok Bot 0.66 发布:Main Bot 主动协调多 Bot 协作 — elonmusk · 2026-10-06
- 开发者开源 agent 剪辑技能:一个月自动产出 168 条短视频 — victor_explore · 2026-10-06
- 开发者用 Claude Design 快速验证复杂交互,静态原型已过时 — austin_malerba · 2026-10-06
- AI agent 以用户身份把银行余额发进公司 Slack,引发安全之忧 — altryne · 2026-10-06
- Tessl 讲解 Harness Engineering:如何搭建由 agent 承包产出的软件工厂 — AI Engineer · 2026-10-06