金融验证引擎基准测试:确定性部分满分,LLM 接口仅通过 29%

MuhammadMujtaba21 · reddit · 2026-08-21

作者构建了一个用于 AI 生成金融声明的确定性验证引擎,并进行了 66 个案例的基准测试。当引擎接收预定义的结构化声明时,准确率达到 100%(66/66);但当使用 Azure OpenAI GPT-5.1 实时生成声明并通过同一管道时,通过率骤降至 29%(19/66)。失败主要发生在声明绑定和管道执行阶段,而非确定性计算或规则应用部分。这表明验证架构本身有效,但 LLM 将输出转换为正式系统所需结构化声明的能力仍不足。作者计划增加更细粒度的诊断来对比预期声明、原始输出和标准化声明。

所属事件:金融验证引擎基准:结构化输入满分 LLM 直连仅 29%(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →