RLVR 微调小模型修 LaTeX 报错:83.7% 修复率、快 6 倍、成本仅 1/40
simonguozirui · x · 2026-09-17
Tinker 团队(Sundial)用 RLVR 方法微调 thinkymachines 的 Inkling-Small,专门修复编辑器内的 LaTeX 编译错误:在真实错误上修复率达 83.7%,效果对标 Claude Fable 5.1,但速度快 6 倍、成本约为 1/40($0.0013/次),响应不到 1 秒。
训练上他们强调把 RLVR 做对:
- 只在经过验证的真实修复上训练,而不是人工制造的合成错误
- 奖励设计刻意抑制 reward hacking,打分采用确定性评分
动机来自对数学家的访谈:日常最烦的就是和 LaTeX 编译错误搏斗。直接问聊天机器人虽然可行,但切窗口打断写作心流,复制粘贴还容易丢失上下文(多文件场景尤甚)。为此他们从 TeX.StackExchange 抓取 27.2 万个问题,筛出 3,978 条 snippet 符合条件的做成训练数据。
「编程与Agent」频道最新
- YC 用 GLM-5.2 造出 AI 合伙人,延迟比 OpenAI 低 31% — ycombinator · 2026-09-17
- 开发者实测 Claude Managed Agents:沙箱可独立编排 — trq212 · 2026-09-17
- 开发者改口:MCP 比命令行工具更适合大多数集成场景 — trq212 · 2026-09-17
- 给 Claude 直接定制工具形态,胜过用间接层「哄」模型 — trq212 · 2026-09-17
- Codex 额度耗尽有救:换号登录可找回全部聊天记录续用 — TheMoonMidas · 2026-09-17
- Vercel fx 默认安全审查将换用 Jev:比 GPT Luna 快 5-18 倍更准 — thesaraharminta · 2026-09-17