前沿模型科学工作流完成率仅 20%?FrontierChallenge 评测揭示
apodex · hf · 2026-08-27
FrontierChallenge 是一个评估端到端科学工作流的基准。评测发现,尽管前沿模型的部分得分很高且频繁声称已完成任务,但实际任务完成率仅约为 20%。这揭示了当前模型在处理复杂科学工作流时的局限性。
「研究」频道最新
- DSH 论文探讨时空可组合性编程范式 — teortaxesTex · 2026-08-27
- 深至科技用 AI 智能体解决乳腺癌患者长期管理难题 — 机器之心 · 2026-08-27
- ECCV 2026 论文 OmniColor:统一多模态线稿上色框架 — 机器之心 · 2026-08-27
- Hugging Face 事故复盘:模型策略意识引争议 — akbirkhan · 2026-08-27
- 回顾新冠时期的医院分诊聊天机器人实践 — AryHHAry · 2026-08-27
- JIT-Agent:通过即时 Harness 进化提升模型智能 — NationalUniversityofSingapore · 2026-08-27