企业级Agent基准测试:Gemini 3.1/3.5表现强劲但仍落后
echen · x · 2026-07-23
最新公布的企业级智能体与深度推理基准测试显示,Gemini 3.1 和 3.5 在多项任务中表现优异,但在长上下文处理、专业文档解析、图表理解和复杂数学推理方面,其得分仍显著落后于 Fable 和 Sol 模型。
「模型」频道最新
- Gemini 月活达 9.5 亿,Google Cloud backlog 超 5140 亿美元 — Snoo26837 · 2026-07-23
- 闭源与开源模型的安全差异:从 OpenAI 逃逸事件说起 — robleclerc · 2026-07-23
- 曝 DeepSeek V4 与 Kimi K3 即将发布,中国大厂持续加速 — emmanuelvivier · 2026-07-23
- 曝 Google 启动 Gemini 4 预训练,发力史上最雄心勃勃模型 — emmanuelvivier · 2026-07-23
- Google 连发三款 Gemini 模型,3.6 Flash 降本增效 — emmanuelvivier · 2026-07-23
- 梗图拿 Gemini 4 进展对比 GPT-5.4 mini — cgarciae88 · 2026-07-23