实测腾讯混元 Hy4:执行能力跻身开源模型第一梯队
HeyAmit_ · x · 2026-08-30
作者在 WorkBuddyAI 中测试了腾讯混元 Hy4 preview 模型。该模型总参数 770B,激活参数 49B,支持 100 万 token 上下文。测试发现其最大亮点在于执行而非回答质量:能够拆解任务、跨工具工作、处理长上下文、编写代码并自我验证。在腾讯 203 个工程任务的盲测中,Hy4 预览版得分 2.99/4,超过 GLM 5.3 和 Kimi K3。作者认为其体验更接近 Agent 而非聊天机器人。
「编程与Agent」频道最新
- Záboj上车:原生CarPlay的语音MCP客户端 — prokopsim · 2026-08-30
- 企业级 MCP 代理怎么选?需解决 Agent 调用超时与流量可观测性难题 — OwlZealousideal4779 · 2026-08-30
- 演讲复盘:Vibe Coding 正在改变我们构建软件的方式 — MyCreativeOwls · 2026-08-30
- Anthropic 推硬件标准:让 Claude 操控显微镜与机械臂 — emmanuelvivier · 2026-08-30
- 五分之一企业难实时叫停失控 Agent,治理风险显现 — emmanuelvivier · 2026-08-30
- WIRED 独家:OpenAI 正为 Codex 开发持续模式,无需人工催促自动干活 — emmanuelvivier · 2026-08-30