前沿模型科学工作流完成率仅 20%?FrontierChallenge 评测揭示

apodex · hf · 2026-08-27

FrontierChallenge 是一个评估端到端科学工作流的基准。评测发现,尽管前沿模型的部分得分很高且频繁声称已完成任务,但实际任务完成率仅约为 20%。这揭示了当前模型在处理复杂科学工作流时的局限性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →