开源 CLM 叫板闭源 Jev:快 4-13 倍、75MB 可微调、刷榜 Terminal-Bench
R_Duncan · reddit · 2026-09-24
CLM 是一个开源权重的 TypeSafe Jev 替代品,实现完全相同的三个决策原语——Choice(候选概率分布)、Noul(校准的真假判断)、Score(量表打分),现有 Jev 客户端代码可直接指向 clm-serve 端点。
CLM 的优势:
- 架构上把状态头与动作头分离,持久工具集只需嵌入并缓存一次,在浏览器 agent 和游戏(T-Rex、Super Mario)基准上比闭源云服务 Jev 快 4-13 倍
- 权重仅约 75MB,可用自己的 agent 轨迹微调;微调后在 Terminal-Bench 2.1 达 87.6%、DeepSWE 达 81.6% 的 SOTA verifier 成绩(零样本 Jev 在 DeepSWE 仅约 71%)
- 零 API 成本、可自托管
Jev 仍领先的点:零样本开放域边缘案例更准(BFCL v4 上 99.2% vs 95.2%);上下文支持 64K,而 CLM-8B 仅校准到 2-8K;Jev 的打分按绝对标准内部校准,CLM 只相对当前候选集归一化。结论:换用 CLM 不损失任何 API 功能,牺牲的只是小众域的零样本泛化。
「编程与Agent」频道最新
- Google 开源 EnvHarness:让 agent 训练环境随其进化 — bendee983 · 2026-09-24
- 作者还原全程:AI 通宵做 demo,唯一干预是拦下一次 rm -f — gandamu_ml · 2026-09-24
- Claude Code 5.5 拒用 Mac 终端还称「技术上不可能」,用户怒斥嘴硬 — burkov · 2026-09-24
- 「我爱 agentic coding,现在每天忙着用测试框架折磨它」 — cjimti · 2026-09-24
- Liquid AI 自称首个可靠端侧 Agent 模型,AI Engineer 大会首次现场演示 — helloiamleonie · 2026-09-24
- 用 Opus 5.5 花 8 小时和 1874 美元 token 做出交互式海岛 — Outside-Iron-8242 · 2026-09-24