HumanEvals 开源:给多模态模型评测接入真实人类判断
_akhaliq · x · 2026-08-19
Datapoint 发布开源库 HumanEvals,可为多模态模型评测加入真实人类判断:发送图像、视频或音频输出,几秒内获得真实标注者的两两偏好、评分或排序。
- 与自动评测库(如 autoevals)接口一致,返回兼容的 Score 对象。
- 人类标注走 Datapoint 标注 API——与头部图像/音频/视频模型实验室评测 checkpoint 所用的同一标注池,吞吐达 5000+ 标注/分钟。
- 支持两两比较、量表评分、多选分类、多候选排序,常用于训练中的 checkpoint 评测与竞品对标。
「编程与Agent」频道最新
- Puck 支持实时语音:通过对话协调多智能体工作 — HankYeomans · 2026-08-19
- Code.Storage 开放注册:专为 AI Agent 设计的无限制 Git 基础设施 — dsp_ · 2026-08-19
- 利用有向图工作流提升 Agent 路径可预测性 — rseroter · 2026-08-19
- 用 Maestro+Tailscale 在 iPhone 上远程提示本地 agent — cocktailpeanut · 2026-08-19
- LlamaParse 在文档视觉定位上碾压通用 VLM — llama_index · 2026-08-19
- ComfyUI 推出官方本地 MCP,无缝连接 Claude 等智能体 — crystal_alpine · 2026-08-19