53 个模型、56 项基准的逐题输出数据集公开发布

sanmikoyejo · x · 2026-09-29

研究者 MeeraDesai18 团队为开展基准有效性分析,收集了 53 个模型在 56 项能力与安全基准上的输出与得分,并公开了包含逐题模型响应与分数的完整数据集(托管于 Hugging Face,madesai/what-ai-benchmarks-actually-measure)。该数据集可用于复现其基准相关性分析及开展独立的评测方法研究。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →