Pokédex 视觉横评:同一 Prompt 实测多款 AI 编码模型

kevinkern · x · 2026-09-23

开发者 Kevin Kern 推出「Pokédex Benchmark」:让所有模型用同一 prompt 和参考图构建一个宝可梦图鉴应用,代码质量由 GPT-6 Astra 评分(满分 100),并记录耗时、成本与 token 数,全部成品可在线试玩和两两对比。

主要结果:Opus 5.5 代码质量最高(80/100),GPT-6 Astra 最快(8 分 08 秒)但代码质量仅 65;DeepSeek 单跑 69 分、耗时 23 分 27 秒;混合流水线 Astra→DeepSeek 也能达到 80 分。站点同时公开了完整 prompt、源码和逐模型点评,读者可自行盲测各模型。

所属事件:开发者推 Pokédex 基准趣味实测多款 AI 编码模型(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →