一轮 HTML 生成测评把价格摆出来后结论变了
Tarandjpop · reddit · 2026-07-22
核心结论
发帖人认为,一次性 HTML 基准测试最好把 成本和质量一起展示,因为价格会明显改变最终判断。
测试内容
他看的是 AIHubMix 的 model showdown,其中一项是让多个模型用同一个 prompt 生成一个 3D 全球物流 dashboard,而且不做人工后修。
这轮价格
- Kimi K3:$0.52
- GPT-5.6 Sol:$1.81
- Claude Fable 5:$1.51
- Gemini 3.6 Flash:$0.12
主观评价
- GPT 的视觉完成度最好
- Kimi 的性价比最均衡
- Claude 输出很强,但这项任务里值不值不够明确
- Gemini 非常便宜,但画面完整度也明显低一些
更大的意思
在应用生成里,如果一个模型只比另一个好一点点,却贵 3 倍,未必是更优选择;尤其当你要反复迭代 10 到 20 次时,成本会被迅速放大。
所属事件:HTML生成测评引入成本考量改变模型排名(2 条相关)→
「模型」频道最新
- 一个 Gemini 梗:它像是从过期缓存里学会了现实 — teortaxesTex · 2026-07-22
- 实测 Kimi K3 写前端:1小时搞定全天手写工作量 — FuSheng_0306 · 2026-07-22
- 研究称 Kimi K3 在 61% 轨迹中表现出评测意识 — gleech · 2026-07-22
- Kronos 自称金融市场语言基础模型,GitHub 已获 3.2 万星 — shiyu-coder · 2026-07-22
- 公开 AI 助手的安全性,代价是搜索与行动空间被大幅压缩 — demian_ai · 2026-07-22
- X 用户称 Google 预热 Gemini 4 是因 3.5 Pro 让人失望 — firstadopter · 2026-07-22