Frontier-Bench 发布 v0.1,带来 74 个任务的持续更新基准
tokenbender · x · 2026-07-24
Frontier-Bench 被做成了一个 持续更新的 benchmark。
首个版本 v0.1 包含 74 个高难度、多样且高质量的任务。团队表示会定期加入新任务并持续改进现有任务,试图解决传统 benchmark 随时间“失效、贬值”的老问题。
所属事件:Frontier-Bench基准发布以评估前沿AI智能体(3 条相关)→
「研究」频道最新
- Robocurve 要给机器人做真实世界物理任务基准 — garrytan · 2026-07-24
- AI 周报汇总:企业采用、长时程安全与 Kimi K3 — burkov · 2026-07-24
- PyTorch:合成训练数据可帮助训练量子纠错解码器 — PyTorch · 2026-07-24
- Eterna 推出 RNA 结构设计挑战,人类专家正面对决 GenAI — chaitjo · 2026-07-24
- Reddit 讨论用 Blender 稳定 AI 视频关键帧的一致性流程 — Alone-Performer5065 · 2026-07-24
- 有人想把人类随机行为做成长期数据集来研究 — PleasantLow670 · 2026-07-24