实战:用 MCP + Codex 批量审计并修复 HumanEval 数据集错误
code_star · x · 2026-08-22
作者利用通过 MCP 服务器接入的 Codex 模型,创建了 47 个并发会话,在 2 小时内完成了 MBPP 和 HumanEval 数据集所有样本的审计。不仅发现了 prompt 和测试用例的深层问题,还修复了格式错误及上游数据集中的缺陷。
所属事件:开发者用 Codex MCP 并发审计两大代码基准数据集(2 条相关)→
「编程与Agent」频道最新
- 团队开源 SDK 让开发者三分钟部署带认证支付的完整应用 — PrajwalTomar_ · 2026-08-22
- 观点:AI 将大幅降低 Rust 采用门槛,使其成为大赢家 — ethanniser · 2026-08-22
- Agentfy:面向社交媒体的多智能体编排系统开源 — tom_doerr · 2026-08-22
- 传闻:OpenAI Astra 将是多 Agent 编排的模型星座 — daniel_mac8 · 2026-08-22
- Vercel fx 集成 ACP 协议,支持 Claude Code 等 Agent — jasonkneen · 2026-08-22
- 反向尝试:用 AI Agent 开发笔记应用 — olcan · 2026-08-22