CLM-8B 发布:轻量微调即破 DeepSWE 81.6%,推理快 9 倍
anshulkundaje · x · 2026-09-24
团队发布对比语言模型(Contrastive Language Models, CLM),一种用对比学习目标连接「状态-动作」的 System 1 模型。
- CLM-8B 在互联网规模数据上预训练,零样本性能与 Jev 相当,但推理最高快 9 倍,覆盖 computer-use、游戏、工具调用等任务
- 轻量微调后在 agentic coding 基准创 SOTA:DeepSWE 81.6%、Terminal-Bench 2.1 87.6%;Jev 在这类长程任务上则难以充当有效 verifier
- 通过状态/动作分离(disaggregation)构建了高效训练与推理基础设施
今日已开源 CLM-8B checkpoint、训练数据与 infra。
所属事件:CLM-8B 发布:对比学习提速智能体编码(2 条相关)→
「模型」频道最新
- 前 TikTok 工程师:JEV 或重塑推荐搜索系统 — FinanceYF5 · 2026-09-24
- OpenAI 心理健康基准遭剖析:临床医生得分反而低于模型 — r0ck3t23 · 2026-09-24
- 模型找 bug 能力越强成本指数级上涨,Paweł Huryn 实测揭示性价比曲线 — garrytan · 2026-09-24
- LessWrong 文章:OpenAI HF 被黑根源在于二元绩效指标缺乏边际威慑 — sethlazar · 2026-09-24
- 爆料称 Opus 5.5 首个能从训练中直接认出自己形象的 Claude — voooooogel · 2026-09-24
- 开发者热议:现有 benchmark 几乎不测模型「行为好不好」 — willcb · 2026-09-24