30 轮实测五种代码评审 skill:Vercel 版综合最优
bootstrapper-919 · reddit · 2026-09-18
Reddit 用户 bootstrapper-919 用真实开发任务对 5 个 Claude Code/Codex 代码评审 skill 做了系统横评:3 个真实任务 × 2 个 agent,共 30 个 session,先自己标注问题再算 precision/recall 并做质性评估。
- 综合表现:Vercel skill 最优(Claude Code 8.1 / Codex 7.4),跨两个 agent 都稳定
- Claude Code 官方 review skill 在自家 agent 上分数最高(8.8),但换到 Codex 掉到 5.8,说明 skill 与 agent 平台耦合明显
- Sentry skill 8.0/5.1;社区向的 thermonuclear(6.7/8.1)和 adversarial(6.6/7.0)在 Codex 上反而更强
- 结论:没有全能 skill,按你用的 agent 选配对效果最好的评审 skill
作者称将在评论区附完整分析。
「编程与Agent」频道最新
- Pictify MCP Server:让 AI 助手从 HTML 生成图、GIF 与 PDF — modelcontextprotocol · 2026-09-18
- convalytics:通过 MCP 为 Convex 应用提供只读分析查询 — modelcontextprotocol · 2026-09-18
- 开发者用 Codex 托管 Slack 回复,附完整提示词与自改进机制 — alex_frantic · 2026-09-18
- 开发者用 Codex 起草 Slack 回复:无需反馈即可自我调优 — alex_frantic · 2026-09-18
- 八个月迭代 ATLAS:不动权重把小模型推向接近前沿水平的编码系统 — itigges22 · 2026-09-18
- 新浏览器 API 提案:应用内直接验证邮箱,无需跳出跳转收件箱 — philnash · 2026-09-18