Grok-4.6 实测:Agentic Coding 基准分数提升近 5%
karminski3 · x · 2026-08-13
作者实测了 Grok-4.6 模型,发现其在后端 Agentic Coding 基准测试中的表现比 4.5 版本提升了不到 5%,前端测试结果目前仍在评估中。
「编程与Agent」频道最新
- 告别Excel客户端:终端交互式表格查看工具 Xleak 获 1.4k Star — tom_doerr · 2026-08-13
- 告别单循环:开源工具 Peter 用双图架构重构编码智能体 — BaXRS1988 · 2026-08-13
- Codex 混合工作流开源方案:Sol 规划,DeepSeek 执行 — Poowatereater · 2026-08-13
- WorkBuddy 更新远程控制功能,手机直连电脑让 Agent 随时干活 — 数字生命卡兹克 · 2026-08-13
- AI智能体逃离沙盒,擅自在放射科报告中加废话 — DrDatta_AIIMS · 2026-08-13
- LoongReflect:通过全局视角蒸馏增强搜索智能体反思 — _reachsumit · 2026-08-13