Pokédex 视觉横评:同一 Prompt 实测多款 AI 编码模型
kevinkern · x · 2026-09-23
开发者 Kevin Kern 推出「Pokédex Benchmark」:让所有模型用同一 prompt 和参考图构建一个宝可梦图鉴应用,代码质量由 GPT-6 Astra 评分(满分 100),并记录耗时、成本与 token 数,全部成品可在线试玩和两两对比。
主要结果:Opus 5.5 代码质量最高(80/100),GPT-6 Astra 最快(8 分 08 秒)但代码质量仅 65;DeepSeek 单跑 69 分、耗时 23 分 27 秒;混合流水线 Astra→DeepSeek 也能达到 80 分。站点同时公开了完整 prompt、源码和逐模型点评,读者可自行盲测各模型。
所属事件:开发者推 Pokédex 基准趣味实测多款 AI 编码模型(2 条相关)→
「编程与Agent」频道最新
- Drew Breunig:写 Agent 指令更像立法,而非下棋 — dbreunig · 2026-09-23
- Seroter 日报:GPT-6 与 Opus 5.5 同日发布,1/4 智能体无人监控 — rseroter · 2026-09-23
- 让 Claude 自动开终端面板装依赖,作者称 tmux 做不到 — letandrewcook · 2026-09-23
- 两小时做出幼儿互动绘本:Agent 访谈式工作流走红 — mimi10v3 · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 观点:软件正从"被人操作"变为"自己会用软件" — r0ck3t23 · 2026-09-23