TL;DR Bench 把 12 个基准压到 12% 样本,误差约 2%

latkins · x · 2026-07-25

TL;DR Bench 把 12 个基准整合到一起,覆盖 agentic、coding、world knowledge 和多语言四类能力,包含 τ²-Bench Telecom、PinchBench、APEX-Agents、SWE-bench Bash Only、LiveCodeBench v6、Humanity’s Last Exam、MMLU Pro、SimpleQA、AIME25、Global MMLU Lite 和 Telekom RAG Task4。

帖子强调,这个方案只使用完整基准集 12% 的样本,并通过挑选更难样本来逼近全量跑分;其能力分数通常与完整 benchmark 结果相差不超过 2%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →