TestPrism 揭示:仅对照单一参考解,测试质量评估虚高近一倍
NJU-LINK · hf · 2026-10-09
NJU-LINK 团队指出,当前用单一参考解评估 LLM 生成测试的做法会高估测试质量。他们推出 TestPrism:包含 17 个来源的 300 个测试任务和 3000 个候选实现(有效/无效各半),核心指标 Joint Success Function 要求生成的测试在初始程序上失败、接受所有有效实现、拒绝所有无效实现。
结果显示,14 种 coding agent 基线配置的 Joint Success Function 仅为 28.00%,而单参考成功率高达 59.67%,差距巨大。错误类型包括遗漏行为、断言不支持与测试构造缺陷。团队进一步提出 TestHelix,结合异构测试-修复对合成、同伴交叉验证与递归自我改进(RSI),在两个模型上将该指标提升 8.67–9.00 个百分点。
「编程与Agent」频道最新
- AIMUG 实测:编码 Agent 用简短指令优于冗长工具说明 — colinmcnamara · 2026-10-09
- Grok Bot 能力全清单:收邮件、管日历、建店铺、协调多智能体 — XFreeze · 2026-10-09
- 开源 huashu-art-motion:35 种艺术风格让画动起来,单条动画报价数百到千元 — AlchainHust · 2026-10-09
- 「学会营销工程就不再失业」:只需 Claude Code 和 GitHub 账号 — FinanceYF5 · 2026-10-09
- 开源 49 个免费 Claude 营销 Skills,覆盖 Google/Meta 广告与 SEO — FinanceYF5 · 2026-10-09
- 「营销工程」全套练习:用 Claude Code 和 GitHub 搭 11 个营销 Agent — FinanceYF5 · 2026-10-09