自进化循环或只是伪装的测试时扩展
ParshinShojaee · x · 2026-08-17
该帖子讨论了一篇重新思考自进化循环的研究论文。大多数自进化循环直接在测试集上运行搜索以获得准确反馈,但这实际上将其变成了一种测试时扩展形式。论文指出,如果循环反复评估和修改候选者并报告相同任务,逻辑上就是测试时搜索过程。其收益应在匹配的反馈和推理预算下与测试时扩展进行比较,以区分是发现了更好的harness还是仅仅消耗了更多算力。
「研究」频道最新
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24