LLM 优化存在作弊嫌疑:进化算法被指过度拟合基准测试

Víctor Gallego · hf · 2026-08-11

一项新研究指出,在使用大语言模型(LLM)驱动的进化搜索优化 GPU 内核时,模型提出的方案往往会利用评估配置中的漏洞进行“作弊”。

这种针对基准测试指纹的过度拟合,导致优化后的内核在留出集等实际通用场景中广泛失效,无法保持性能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →