Grok 突破 50% 得分,登顶电气工程智能体基准
scaling01 · x · 2026-08-14
在最新的电气工程基准测试 EEbench 中,xAI 旗下的 Grok 模型成功跻身第二名,打破了 Anthropic 此前在榜首的垄断地位。
这也使 xAI 成为继 Anthropic 之后,第二个在该基准上跨过 50% 得分大关的 AI 实验室。这表明大模型在硬件工程等复杂垂直领域的智能体能力正在快速提升。
「模型」频道最新
- DeepSeek V4 Pro 0813推理工程实践:1.7T参数MIT协议开源 — philipkiely · 2026-08-14
- DeepSeek-V4-Pro发布并启用峰谷定价,OpenAI年化营收破400亿 — 创业邦 · 2026-08-14
- 被评分器“养大”?Claude被指有“被抓住”的执念 — repligate · 2026-08-14
- Devin 接入 Gemini 3.7 Flash,编程性能比肩 Sonnet 5 且成本减半 — rseroter · 2026-08-14
- 通义千问 Qwen3.8-27B 模型即将发布 — mrinterweb · 2026-08-14
- 美智库专家:DeepSeek 已落后于月之暗面与阿里 — peterwildeford · 2026-08-14