实战:用 MCP + Codex 批量审计并修复 HumanEval 数据集错误

code_star · x · 2026-08-22

作者利用通过 MCP 服务器接入的 Codex 模型,创建了 47 个并发会话,在 2 小时内完成了 MBPP 和 HumanEval 数据集所有样本的审计。不仅发现了 prompt 和测试用例的深层问题,还修复了格式错误及上游数据集中的缺陷。

所属事件:开发者用 Codex MCP 并发审计两大代码基准数据集(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →