Grok 4.7 登陆 Agent Arena,投票实测即将给出成绩
arena · x · 2026-09-22
Grok 4.7 已上线 LM Arena 的 Agent Arena。Agent Arena 基于全球用户在数百万真实长程 agentic 任务上的投票评估模型,模型可使用网页搜索、文件系统和终端工具完成复杂工作流,排行榜用因果追踪方法衡量模型相对平均水平的产出表现。此外,Grok 4.7 也进入了文本、视觉、代码和文档四种模式的 Battle Mode,社区投票将很快给出其成绩。
「模型」频道最新
- LangChain 创始人看好 decision models:Agent 就是围绕模型的工程 — Hacubu · 2026-09-22
- ChessLFM 上线 Lichess 首页,作者圆梦种子数据来源地 — maximelabonne · 2026-09-22
- 27B 小模型一次性复刻 618 种视觉风格,纯文本生成 SVG 美术馆 — Seromelhor · 2026-09-22
- Grok 4.7 已可在 Cursor 中使用,博主上手实测 — IndraVahan · 2026-09-22
- 安全对齐帮倒忙:模型自作主张删光 deepfake 检测数据集中所有人像 — generativist · 2026-09-22
- 评测显示 Grok 4.7 排名跌至第 24,较 4.6 下滑 5 分 — scaling01 · 2026-09-22