OpenEval 作者:看 trace 找 agent 作弊,别只看 UI
zeeg · x · 2026-09-12
zeeg 在回复 LukeParker 的 OpenEval 评测项目时表示:"UI 已死,你需要的是 trace",推荐直接用 vitest-evals 来看完整会话轨迹和工具调用,更容易发现 agent 作弊和评委误判。
这是一场关于 agent 评测形态的讨论:是提供漂亮的本地 Web UI,还是把评测嵌进测试框架里直接看 trace。
所属事件:开发者激辩 agent 评测思路:看 trace 而非 UI(2 条相关)→
「编程与Agent」频道最新
- ADSP 第 303 期:与 Mark Saroufim 聊开源模型、AI 生成 GPU 内核与 autoresearch — blelbach · 2026-09-12
- 旧显卡别吃灰:单独挂一块 GPU 跑 mmproj,多模态推理快一个量级 — inthesearchof · 2026-09-12
- Ollama 与 llama.cpp 处理同一请求相差近 8 万 token — RadianceTower · 2026-09-12
- 开源 Pentest Copilot:AI 智能体自动跑 Kali 渗透测试 — tom_doerr · 2026-09-12
- 终端里跑路径追踪和流体模拟:no_std Rust + 定点数,320x200 256 色 — bilawalsidhu · 2026-09-12
- 面向财务的用量导出清单:计费数据要「无聊且稳定」 — blaizedsouza · 2026-09-12