腾讯 Hy3 在 Agent Arena 开权重榜拿到第 5
arena · x · 2026-07-22
Tencent 的 Hy3 在 Agent Arena 里拿到开权重模型第 5,同时在 Frontend Code Arena 里拿到开权重模型第 2。
这份评测说明了什么
- Agent Arena 总榜:第 25,净提升 -2.2%。
- 优势在 工具使用,尤其是遇到 CLI / bash 报错时的恢复能力。
- 短板是 可 steer 性:当用户提出反驳或改方向时,模型不太会及时纠偏。
- 该榜单覆盖的是百万级真实长链路 agent 任务,包括网页搜索、文件系统、终端、做幻灯片、搭应用、文档分析等。
整体看,Hy3 在 agentic 工作流里表现不差,但在综合满意度和可控性上还不是第一梯队。
所属事件:腾讯混元 Hy3 前端代码竞技场夺开源第二,智能体榜单表现分裂(8 条相关)→
「编程与Agent」频道最新
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11