TL;DR Bench 把 12 个基准压到 12% 样本,误差约 2%
latkins · x · 2026-07-25
TL;DR Bench 把 12 个基准整合到一起,覆盖 agentic、coding、world knowledge 和多语言四类能力,包含 τ²-Bench Telecom、PinchBench、APEX-Agents、SWE-bench Bash Only、LiveCodeBench v6、Humanity’s Last Exam、MMLU Pro、SimpleQA、AIME25、Global MMLU Lite 和 Telekom RAG Task4。
帖子强调,这个方案只使用完整基准集 12% 的样本,并通过挑选更难样本来逼近全量跑分;其能力分数通常与完整 benchmark 结果相差不超过 2%。
「研究」频道最新
- Jacobian 反例提示,可解释性局部保证未必全局成立 — forestmars · 2026-07-25
- Anthropic 称 Opus 5 更省 token,也更适合编码任务 — alexalbert__ · 2026-07-25
- BPBench 显示中文开源模型压缩能力领先 — ctnzr · 2026-07-25
- AI 条约核验或需三层路线:现实检查、enclave 与密码学 — geoffreyirving · 2026-07-25
- 安全 enclave 仍可能被侧信道和显微攻击泄露密钥权重 — geoffreyirving · 2026-07-25
- 只靠密码学做 AI 核验仍要付出多个数量级的性能代价 — geoffreyirving · 2026-07-25