E2A-Bench 评估金融图表推理:视觉模型证据链难以支撑行动
Xiaoya Wang · hf · 2026-09-15
Xiaoya Wang 等发布 E2A-Bench,一个评估金融图表推理中「证据到行动」(Evidence-to-Action)可靠性的 benchmark。
核心发现:视觉语言模型经常无法维持可追溯的证据-行动链条——即便得出正确结论,也难以保证结论背后有可验证的证据支撑。作者指出应评估完整推理链,而非单一的幻觉分数,凸显现有评估方式的盲区。
「研究」频道最新
- TabPFN-3.5 发布:支持时序与分组数据,推理最快提速 6 倍 — FrankRHutter · 2026-09-15
- Google 发报告:1500 万次 Gemini 交互揭示 AI 如何改变科学研究 — danielrock · 2026-09-15
- 果蝇全脑连接组爆红:16.6 万神经元被网友塞进 Minecraft 和比特币交易 — 404 Media · 2026-09-15
- EMNLP 新论文:评测 LLM 不该只看答案对错,还要看回答的框架方式 — IAugenstein · 2026-09-15
- Liquid AI 开源 antidoom 训练法:用 FTPO 破解小模型 doom loop — helloiamleonie · 2026-09-15
- Ataraxis 发布因果 AI 模型:从乳腺癌零样本泛化至多种实体瘤 — multiply_matrix · 2026-09-15