金融验证引擎基准:结构化输入满分 LLM 直连仅 29%

有开发者构建了用于验证 AI 生成金融主张的确定性引擎,并在 66 个案例上进行基准测试。当引擎接收预定义的结构化声明时全部通过(66/66,准确率 100%);但当通过 Azure OpenAI 的 LLM 直接接入时,通过率仅约 29%。结果表明,在金融等高风险场景中,结构化输入配合确定性验证远比直接依赖大模型接口可靠。

2026-08-21 ~ 2026-08-21 · 2 条相关