实测腾讯混元 Hy4 预览版:3 美元修 17 个 bug 位居性价比前沿
PawelHuryn · x · 2026-08-28
作者在 2 个真实代码仓库中植入 105 个高难度 bug,让各家模型「找出并修复」,实验室并不知道答案,测试更贴近实战。
结果:
- Fable 5 (max):29/105,花费 $104.49
- Opus 5 (max):27/105,花费 $51.33
- Qwen3.8-Max (xhigh):18/105,花费 $31.19
- Hy4 preview (默认):17/105,仅花 $3.13
- Gemini 3.7 Flash (high):16/105,花费 $6.36
作者评价:Hy4 预览版不算突破,但在 Luna 榜单高分之外,它实际落在性价比 Pareto 前沿上,且开放权重,是日常编码的又一个扎实选择。
所属事件:实测腾讯混元 Hy4:3 美元修复 17 个 Bug 性价比领先(4 条相关)→
「编程与Agent」频道最新
- 一文读懂 AI 模型与 Agentic Harness 的区别 — _jaydeepkarale · 2026-08-28
- AssemblyAI 拆解语音 Agent 架构 — AssemblyAI · 2026-08-28
- 客户执意要做 AI Agent,其实只需要简单的上下文记忆 — Radiant-Scarcity2333 · 2026-08-28
- 在 Docker 沙箱里,如何信任 AI Agent 修改的可追溯性? — pineconeseedling · 2026-08-28
- 用 Cursor 挑战 72 小时极限开发,从零构建 3D 大学校园 — tristanbob · 2026-08-28
- MemBukkit 开源:换个思路做 LLM 长期记忆,简单索引打平花哨方案 — AOZakari · 2026-08-28