新基准 CorporateBench 测大模型处理 23 万企业文档能力

_reachsumit · x · 2026-08-28

Sil Hamilton 等人提出了 CorporateBench (CB),一个经过人工验证的大规模多任务问答基准测试,旨在模拟企业沟通网络中的真实环境。该基准包含超过 23 万个文档,覆盖了从 12 人到 1 万人的 4 家合成公司。数据基于随时间演化的知识库生成,确保了跨文档的逻辑一致性。评测显示,随着输入规模接近现实水平,5 个被测 LLM 的性能均显著下降。该基准填补了企业级通信推理评估的空白。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →