MetaLint 论文:Qwen3-4B 代码 lint 检测 F 值提升 2.7 倍,媲美 o3-mini
dan_fried · x · 2026-09-29
CMU 团队将在 #COLM2026 展示 MetaLint:把代码 linting 形式化为指令跟随任务,模型根据自然语言规范判断代码是否符合最佳实践,无需重训即可泛化到未见或演进中的规则。仅用自动 linter 生成的合成数据训练,模型就能泛化到更难、依赖上下文的最佳实践;论文还发布了基于 PEP 的人工精选困难基准。Qwen3-4B 在该基准上检测 F-score 从 25.9% 提升到 70.4%(2.7 倍),召回率最高,定位 F-score 达 26.7%,比肩 o3-mini 等更大模型。作者还将展示关于长程编码 agent 中「slop」评估的工作。
「编程与Agent」频道最新
- AlignOPSD 决策对齐蒸馏,长程 Agent 性能超 GRPO 5.5-8.7% — Mingju Chen · 2026-09-29
- CompoWorld 用可组合环境扩容通用智能体训练任务空间 — AllSpark-Research · 2026-09-29
- 北航提出 ACG 图结构记忆,长程 Agent 成功率 44.5% 提至 50.2% — Beihang · 2026-09-29
- 字节 TraceDance 从真实部署轨迹自动构建 Agent 行为基准 — ByteDance · 2026-09-29
- Databricks 用 AI 智能体登顶 NVIDIA 内核榜单,总花费仅约 7 万美元 — Yuchenj_UW · 2026-09-29
- ADHD 成超能力:一人同时跑十个 agent 还能做饭发帖 — enggirlfriend · 2026-09-29