Gemini ER 2 具身推理评测全面超越 Claude Opus 与 Sol
Zergylord · x · 2026-07-30
在最新的具身推理基准测试中,Gemini ER 2 展现出强劲实力,全面击败了 Sol 5.6 (x-high) 和 Claude Opus (max)。仅在极个别特定测试项中未能领先。发帖者对 Anthropic 表示祝贺,并戏称下次将努力反超。
「模型」频道最新
- PolyAI 发布 Dialog-RSN-1 语音模型,企业实测击败 GPT 和 Gemini — matthen2 · 2026-07-31
- 传 xAI 下周将发布 Grok 4.6 — mark_k · 2026-07-31
- 提出按每瓦特智能衡量模型,揭示前沿定价无护城河 — ajratner · 2026-07-31
- CrisperWhisper2.0 上榜 HF:高精度逐字转写与词级时间戳 — nyralabs · 2026-07-31
- OpenAI GPT-5.6 模型上线亚马逊 Bedrock,支持显式提示缓存 — AWS ML Blog · 2026-07-31
- 开发者实测:把 Claude Opus 当作不可控的疯狂 Agent 效果更好 — brandon_galang · 2026-07-30