FrugalEvo 算成本账:1.68 美元刷新圆填充 SOTA,仅为基线 50 美元的 3%
Hui Chen · hf · 2026-10-05
研究团队提出 FrugalEvo,一个成本感知的 LLM 引导程序进化框架,主张优化应最大化单位成本的收益,而非固定迭代次数下的性能。
框架设计:
- 用更强但更贵的 LLM 探索解法策略,用更便宜的 LLM 负责实现与迭代细化代码;
- 缓存友好的进化流程:harness 与 prompt 最大化前缀共享以提升缓存复用;
- 提出 BA-AUC(Budget-Aware Area Under the Curve)指标:在固定成本预算内,以累计 LLM 成本为横轴的最优解得分曲线下面积。
结果:
- 在 10 个数学与系统优化任务上,最终解质量持平或超越 OpenEvolve、ShinkaEvolve、AdaEvolve、EvoX 等 SOTA 基线,9 个任务上 BA-AUC 更高;
- 在 ALE-Bench-Lite 的 10 个算法优化任务上平均表现也更好;
- 圆填充(circle packing)上,用 GPT-5.6 Terra/Luna 仅花 1.68 美元、用 GLM-5.3 及其 Flash 变体仅花 0.55 美元刷新 SOTA,而多智能体基线 CORAL、SwarmResearch 平均成本约 50 美元。
「研究」频道最新
- SWE-Chat v2 发布:18K 真实用户 23 万条编码 Agent 交互数据集 — Diyi_Yang · 2026-10-06
- ICML 论文:语料中的负面 AI 叙事会让模型真的更不对齐 — Michael_D_Moor · 2026-10-06
- 每加一条规则都更糟:LLM Agent 提示词踩坑复盘 — Adorable-Algae6903 · 2026-10-06
- World Labs 发布 LoGo:局部+全局奖励提升视频生成 3D 一致性 — georgiagkioxari · 2026-10-06
- Harbor 统一评测与 RL rollout 契约,直击 agent 基准三大落地难题 — rseroter · 2026-10-06
- 医疗 LLM 评测陷「基准过期」困境,新研究推活基准解法 — davidjhwu · 2026-10-06