博士团队筹建开源 Agent 工作流基准,公开征集痛点需求
Groofy_beautypie · reddit · 2026-10-02
一个主要由博士生组成的团队正在筹备一个开源基准,聚焦真实 LLM/Agent 工作流,填补现有学术基准的盲区。
他们列举了现有基准的典型不足:
- 过于宽泛,无法匹配具体应用场景
- 难以覆盖多步骤、多工具、MCP server、多 Agent 或长程交互的流程
- 标准准确率指标漏掉了真实失败模式
- 医疗、金融、网络安全、法律等高风险领域更看重安全与可靠性,而非答案正确与否
- 从零自建基准成本太高
团队公开征集「生产上必须做但没有好的评测方法」的工作流案例,询问大家想测什么、现有基准为何不够用。
所属事件:博士团队筹建开源Agent工作流基准并征集需求(2 条相关)→
「研究」频道最新
- Sasha Rush 将出席 COLM 2025,公开邀约聊测试时训练与有偏 RL — srush_nlp · 2026-10-02
- CISPA 第二年开设《非精确概率机器学习》课程并全球直播 — krikamol · 2026-10-02
- SoftServe 拟牛顿法上 GPU,病态科学任务胜过 Adam 与 Muon — dianarycai · 2026-10-02
- SoftServe 更新源自二次矩阵方程,延续 Batch-and-Match 思路 — dianarycai · 2026-10-02
- DyRAD 发布:用雷达重建动态驾驶场景,可渲染完整距离-方位-多普勒张量 — orlitany · 2026-10-02
- EMBL-EBI 团队开源 Karenina 框架:多维评测生物医学 AI 的 LLM 与 Agent — anshulkundaje · 2026-10-02