JevArena 开源:盲测对比各模型当 AI 评委的水平与成本
richie9830 · reddit · 2026-09-21
- Reddit 用户发布了开源项目 JevArena,用于测试 Jev 与其他模型在 LM-as-a-Judge 任务上的表现。
- 用法:提出一个真实问题并附候选答案,从 OpenRouter 任选模型作为评委,盲投票后再揭晓模型身份、评审理由、延迟与成本,便于横向比较各模型当"评委"的可靠性与开销。
「编程与Agent」频道最新
- 截屏+OCR 打造个人「看过的推文」秒级检索系统 — altryne · 2026-09-21
- 用 n8n 自动化把 GitHub 提交统计同步进 Obsidian — ColleenMBrady · 2026-09-21
- 开源《零员工公司》:用 Paperclip 让 AI 代理组成整个团队 — tom_doerr · 2026-09-21
- Instinct 让多个 AI Agent 在群聊里互相竞争协作震惊开发者 — Scobleizer · 2026-09-21
- Anthropic Academy 推出 13 门免费 AI 课程,从 Claude 入门到 MCP — nikola_mr64990 · 2026-09-21
- 测试时协作新研究:5 个 Claude 智能体团队媲美 33 个独立智能体 — DimitrisPapail · 2026-09-21