E2A-Bench 评估金融图表推理:视觉模型证据链难以支撑行动

Xiaoya Wang · hf · 2026-09-15

Xiaoya Wang 等发布 E2A-Bench,一个评估金融图表推理中「证据到行动」(Evidence-to-Action)可靠性的 benchmark。

核心发现:视觉语言模型经常无法维持可追溯的证据-行动链条——即便得出正确结论,也难以保证结论背后有可验证的证据支撑。作者指出应评估完整推理链,而非单一的幻觉分数,凸显现有评估方式的盲区。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →