用 Jev 当 LLM Judge:低置信度升级到前沿模型省成本
omarsar0 · x · 2026-09-24
Elvis Omar Saravia 分享其正在测试的 agent 评测方案:用 Jev 做 LLM-as-a-Judge,在高置信度场景下直接采信其判定,当置信度低时升级到前沿模型(如 GPT-6 或 Opus 5.5)复核。
- 这是他目前见过最亮眼的 Jev 用例,但强调 Jev 不适合所有评测场景,前沿模型也一样。
- 早期结果显示这种混合流程在精度与成本之间取得较好平衡。
- 完整指南仍在撰写中,欢迎提问。
「编程与Agent」频道最新
- Sentry 创始人:用模型生成 agent 是最烂的 AI 编码场景 — zeeg · 2026-09-24
- Sentry CEO:用 Agent 造 Agent 是模型生成质量最差的软件 — zeeg · 2026-09-24
- GitHub 与 Muse 达成集成,可连账号审 PR 看通知 — unixterminal · 2026-09-24
- 开发者观点:去做那些代码细节根本不重要的项目才有趣 — kieranklaassen · 2026-09-24
- ChatGPT 语音可经 MCP 直连 Datasette,simonw 现场演示对话个人博客 — reach_vb · 2026-09-24
- 设计师 2 小时用 Figma+Claude+Midjourney 搭出塔罗占卜应用 — AlexisDC · 2026-09-24