LibraryDesignBench 发布:考察 Agent 为其他 Agent 设计代码库的能力

GOrlanski 等研究者推出新基准 LibraryDesignBench,其机制为一个 agent 负责设计代码库,其他 agent 再基于该库编写程序,从而评估 agent 能否既设计出高质量库,又能高效复用。该基准针对当前 agent 倾向于重新实现而非复用已有代码的问题,衡量 agent 在其他 agent 编写的代码之上协同工作的能力。

2026-10-01 ~ 2026-10-01 · 2 条相关