TestPrism 揭示:仅对照单一参考解,测试质量评估虚高近一倍

NJU-LINK · hf · 2026-10-09

NJU-LINK 团队指出,当前用单一参考解评估 LLM 生成测试的做法会高估测试质量。他们推出 TestPrism:包含 17 个来源的 300 个测试任务和 3000 个候选实现(有效/无效各半),核心指标 Joint Success Function 要求生成的测试在初始程序上失败、接受所有有效实现、拒绝所有无效实现。

结果显示,14 种 coding agent 基线配置的 Joint Success Function 仅为 28.00%,而单参考成功率高达 59.67%,差距巨大。错误类型包括遗漏行为、断言不支持与测试构造缺陷。团队进一步提出 TestHelix,结合异构测试-修复对合成、同伴交叉验证与递归自我改进(RSI),在两个模型上将该指标提升 8.67–9.00 个百分点。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →