LLM 金融验证引擎:确定性 100% 通过,直连仅 29%

MuhammadMujtaba21 · reddit · 2026-08-21

作者构建了一个用于验证 AI 生成金融主张的确定性引擎,并在 66 个案例上进行了基准测试。当确定性引擎接收结构化输入时,通过率为 66/66;但当使用 Azure OpenAI (GPT-5.1) 生成主张并直接输入同一管道时,通过率仅为 19/66。失败主要集中在“管道执行失败”和“主张绑定失败”,而非确定性计算或规则应用。这表明问题不在于验证架构本身,而在于 LLM 无法可靠地将输出转换为确定性验证系统所需的确切结构化格式。作者下一步计划添加更细粒度的诊断。

所属事件:金融验证引擎基准:结构化输入满分 LLM 直连仅 29%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →