AgenticBBO-Bench 发布:LLM Agent 黑盒优化横评,GPT-6 Astra 与 DeepSeek-V4.1-Flash 占 Pareto 前沿
Ming Chen · hf · 2026-10-09
来自 LAMDA 团队的研究者发布 AgenticBBO-Bench,首个跨域 LLM Agent 黑盒优化(BBO)基准,统一了此前难以互相比较的研究设置。
基准覆盖:合成函数、超参优化、数据库调优、芯片设计、分子设计,统一有限预算评估协议。
主要发现:
- Agentic BBO 在全部五个域的平均得分都高于直接用 LLM,并在四个域超过最优数值优化器
- 增加数值优化工具并不稳定带来提升;任务语义信息普遍有用,更具体的先验知识反而不可靠
- 数值优化器能充分吸收 agent 建立的搜索轨迹收益
- 五任务前沿挑战中评测 7 个 LLM(采用 Codex agent 框架),GPT-6 Astra 与 DeepSeek-V4.1-Flash 位于性能-成本 Pareto 前沿
代码已开源:github.com/lamda-bbo/agentic-bbo
「编程与Agent」频道最新
- 用 Claude Haiku 与 GPT 小模型一周做出两款可玩游戏,附成本拆解 — chongdashu · 2026-10-09
- 别都 vibe code 到 80%:不如把 token 集中给一个人做到 100% — arjunrajlab · 2026-10-09
- dhh 首次长期把 Codex 当主力、Claude 做副手,盛赞 Sol 6.1 — npew · 2026-10-09
- 泄露的 Claude Code 配置:Sonnet 写码、Haiku 扫库、Opus 当架构师 — Arindam_1729 · 2026-10-09
- 实测:Codex 慢或因客户端而非模型,zcode 同任务快 5 倍 — bdsqlsz · 2026-10-09
- Ralph 作者断言:不用 AI 的团队正在被准备淘汰 — TheZachMueller · 2026-10-09