LMArena 实测:开源模型 Hy3 闯入前端代码榜单前列
arena · x · 2026-07-22
LMArena 公布了最新一期的前端代码竞技场与智能体竞技场实测数据。开源权重模型 Hy3 表现亮眼,在前端代码竞技场中位列开源模型第二名(总榜第 16 名),并在参考设计、游戏、模拟等内容生成工具领域跻身前 20。
但在基于 8000 多次真实会话的智能体竞技场中,Hy3 总体仅排在第 25 位,净改进率为 -2.2%,在确认成功率和可操控性方面均出现下滑,不过在 Bash 环境恢复和工具幻觉控制上有小幅提升。
所属事件:腾讯混元 Hy3 前端代码竞技场夺开源第二,智能体榜单表现分裂(8 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11