新框架让 DeepSeek 超越 Claude,成本仅 1/11
Azaliamirh · x · 2026-08-18
LLM-as-a-Verifier 框架通过自验证机制显著提升模型表现。在 Terminal-Bench 2.1 上,使用 DeepSeek V4 Flash 采样 5 个解并用该框架排序,准确率从 79% 提升至 88%,超越 Claude Fable 5,且成本仅为竞品的 1/4 到 1/11。该框架已开源,支持无需额外训练的细粒度反馈。
「编程与Agent」频道最新
- 英伟达开源 NOOA 框架:用纯 Python 类构建 Agent — solyarisoftware · 2026-08-18
- Claude Code 新增 /design 技能实现 CLI 级 UI 设计 — gaganghotra_ · 2026-08-18
- 如何设计通用的模型分层系统替代硬编码模型映射 — chipro · 2026-08-18
- 自托管 AI 分析师:写 SQL、自查数字、每条结论都标注来源查询 — Outside-Risk-8912 · 2026-08-18
- MCP 协议赋能智能眼镜,语音操控即可自动购物 — Scobleizer · 2026-08-18
- oMLX 长会话内存溢出卡死?给 Pi 加触发词实现自动压缩上下文 — chibop1 · 2026-08-18