前沿大模型在保险业务评估中表现不佳,通过率骤降20%

ajratner · x · 2026-08-07

SnorkelAI 在 CAIS 会议上介绍了名为 UNDERWRITE 的多轮基准测试。该测试由专家构建,基于真实的保险承销等企业复杂业务场景,用于评估 AI 智能体的表现。

在对 13 个前沿模型的测试中,结果显示模型的研究性能与企业实际应用要求存在显著差距。即便提供了工具访问权限,模型依然会产生特定领域的幻觉,且测试通过率(pass^k)下降了 20%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →