评测集翻车:金融基准 BigFinanceBench 答案本身含错
rohanpaul_ai · x · 2026-08-06
博主在分析金融 AI 评测时指出,BigFinanceBench 基准测试的参考答案本身存在严重的金融和数据错误。这意味着即使模型推理完全正确,也可能因为不符合错误的参考答案而被判定为错误。这表明当前的模型评测分数可能部分反映了系统对有缺陷参考答案的迎合程度,而非其真实的金融分析能力。
「研究」频道最新
- COLM论文:视觉语言模型长推理易致监控盲区 — nikaletras · 2026-08-06
- 智能体外壳比模型更重要:金融 AI 评测大幅提升 — eyishazyer · 2026-08-06
- AI Agent 能复现论文,但能独立提出想法吗? — ChenhaoTan · 2026-08-06
- 英伟达发物理 AI 长文:开源世界模型 Cosmos 3 赋能机器人 — nordicinst · 2026-08-06
- 多智能体协作挑战:优化开源大模型数学证明能力 — ben_burtenshaw · 2026-08-06
- 密码学家冷静审视 Anthropic AI 密码分析成果 — JeremyCMorgan · 2026-08-06