GDP基准:真实企业任务评测
echen · x · 2026-07-11
- 新基准发布:推出名为 GDP.pdf 的评测数据集,包含 100 个来自真实企业工作流的任务。
- 专业评分:这些任务由医生、律师、保险理算员和银行家等一线业务专家亲自编写和评分。
- 模型短板:当前 SOTA 模型在处理这些看似枯燥的专业任务时表现不佳,例如在保险理赔中会将房屋错误划入冰雹区域,或漏检明显的损害,却还能生成看似权威的表格。
- 资源开放:已公开数据集和排行榜供测试模型能力。
所属事件:GPT-5.6刷新ARC-AGI-3纪录并在多模态测试中破30%(16 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03