新基准 CorporateBench 测大模型处理 23 万企业文档能力
_reachsumit · x · 2026-08-28
Sil Hamilton 等人提出了 CorporateBench (CB),一个经过人工验证的大规模多任务问答基准测试,旨在模拟企业沟通网络中的真实环境。该基准包含超过 23 万个文档,覆盖了从 12 人到 1 万人的 4 家合成公司。数据基于随时间演化的知识库生成,确保了跨文档的逻辑一致性。评测显示,随着输入规模接近现实水平,5 个被测 LLM 的性能均显著下降。该基准填补了企业级通信推理评估的空白。
「研究」频道最新
- TTPO:无需标签的测试时策略优化 — Aozhe Wang · 2026-08-28
- Aphanta:诊断多模态推理的图像编辑中间态 — Fudan-University · 2026-08-28
- HydroGym:含 60+ 环境的流体控制 AI 训练场 — ricardovinuesa · 2026-08-28
- Miles 支持 Qwen 与 GLM 模型的高效 RL 训练 — ying11231 · 2026-08-28
- Miles-diffusion 推出 LoRA SFT 快速微调扩散模型 — ying11231 · 2026-08-28
- SovietRxiv 新增 7000 篇苏联科学论文英译 — generativist · 2026-08-28