Aiden Bai 补充:ReactBench 用 Harbor,但 eval 问题属全行业
aidenybai · x · 2026-10-10
Aiden Bai 对其『模型评测工具链需要更好的默认值』一帖作补充说明:他们团队在 ReactBench/数据工作中使用 Harbor 框架,但强调评测工具的问题不是 Harbor 特有的缺陷,而是全行业普遍现象。
所属事件:Aiden Bai:行业评测工具链不足,posttrain 前须补强(2 条相关)→
「编程与Agent」频道最新
- 实测把 /autocompact 调到 400k,每周 Claude 用量省 29% — rickasaurus · 2026-10-10
- Eazo 体验:一句话生成可上线 App,含收款与返佣体系 — vista8 · 2026-10-10
- Grok Bot 嵌套运行 Hermes Agent VM,实现多层并行智能体 — alexcovo_eth · 2026-10-10
- Brian Holt:卖掉 42U 机架,一台 Framework 桌面加编码 Agent 更实用 — film_girl · 2026-10-10
- Group-Evolving Agents 获 COLM 2026 奖:SWE-bench 71% 超越人类设计框架 — xwang_lk · 2026-10-10
- 开发者观察:让 agent 修你不懂的 bug,就是现实版连续回形针最大化 — brandon_xyzw · 2026-10-10