MetaLint 论文:Qwen3-4B 代码 lint 检测 F 值提升 2.7 倍,媲美 o3-mini

dan_fried · x · 2026-09-29

CMU 团队将在 #COLM2026 展示 MetaLint:把代码 linting 形式化为指令跟随任务,模型根据自然语言规范判断代码是否符合最佳实践,无需重训即可泛化到未见或演进中的规则。仅用自动 linter 生成的合成数据训练,模型就能泛化到更难、依赖上下文的最佳实践;论文还发布了基于 PEP 的人工精选困难基准。Qwen3-4B 在该基准上检测 F-score 从 25.9% 提升到 70.4%(2.7 倍),召回率最高,定位 F-score 达 26.7%,比肩 o3-mini 等更大模型。作者还将展示关于长程编码 agent 中「slop」评估的工作。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →