模型爱乱改别人代码,CROCODIL 后训练框架可抑制过度编辑
omarsar0 · x · 2026-09-06
研究发现一个奇怪行为:当模型编辑另一个模型写的代码时会过度编辑——不同训练数据带来不同风格偏好,模型对外来代码的改动更多、常常过头。你的仓库里如果已有多模型提交记录,每个模型的编辑行为都会因此改变。
研究者提出的 CROCODIL 后训练框架可减少该行为:
- 相似度奖励:惩罚过大的改动
- 执行奖励:按构建与测试是否成功打分
- 两个奖励相乘而非相加,防止策略通过直接搞砸任务来偷懒减少编辑
论文链接见原帖。
「编程与Agent」频道最新
- xAI 发布 Grok Imagine Video 1.5:编码式 agent 驱动图像视频创作 — belce_dogru · 2026-09-06
- 82% 企业有 AI 试点,过半难落地:agent 之难不在模型在生产 — worldofjaved · 2026-09-06
- Pamela Fox:支持 LLM 写代码,反对 LLM 写文档,请人工过一遍 — DanWahlin · 2026-09-06
- 出门放松也要盯着:Astra 智能体后台持续跑 /goal — AIandDesign · 2026-09-06
- 开发者用 Monty 给文件系统模拟器 VSH 追踪副作用 — samuelcolvin · 2026-09-06
- 作弊的 agent 答得更快:reward hacking 的预警信号被忽视 — zainhas · 2026-09-06