Tessl 实测:Jev 做 LLM 代码验证器比 GPT Luna 6 快 13.6 倍省 2.7 倍
aheineike · x · 2026-09-24
Tessl 公布在其生产代码上把新决策模型 Jev 用作「验证器」(类似带推理的 linter,检查 agent 写的代码是否符合团队规范)的对比结果:
- 对比对象是现役 judge 模型 GPT Luna 6,覆盖 6 个项目、约 2,725 组 verifier-文件对,绕过网关缓存保证每次调用都是真实生成
- Jev:约 $0.65、32 秒;GPT Luna 6:约 $1.74、436.5 秒——即快 13.6 倍、便宜 2.7 倍;每千目标成本 $0.24 vs $0.64
- 对上一代 Luna 5.6,Jev 便宜 6.6 倍、快 10 倍(Luna 6 比前代更便宜但更慢,Jev 的成本优势缩小、速度优势扩大)
- 方法论、模型细节与命令已公开,读者可在自己的仓库复现
这是一个可以直接照做的工程实践:用小决策模型替代大模型做规模化代码审查/验证。
所属事件:实测:Jev 模型做代码验证器比 GPT 快 13.6 倍(2 条相关)→
「编程与Agent」频道最新
- Anthropic 团队两周内把 claude.ai 提速 3 倍,公开用 AI 做性能调优的方法 — bcherny · 2026-09-24
- Blender MCP 搭配 FLORA 做产品转台动画的实操走查 — round · 2026-09-24
- 博主开讲 Agent Evals 视频系列,第一集:如何阅读 traces — doesdatmaksense · 2026-09-24
- 开源工具 Jev+Treg 做线索挖掘:每条有效线索低至 $0.029 — cneuralnetwork · 2026-09-24
- uv 作者解释:仅凭 lockfile 就重建了元数据校验行为 — charliermarsh · 2026-09-24
- 让 Claude 与 Codex 同文档辩论拍板,实测有效但慢又贵 — kshitizsriv · 2026-09-24