Gemini 3.6 Flash金融AI测试登顶,单次成本仅2.4美元
tulseedoshi · x · 2026-07-31
在 Samaya AI 推出的开放式金融 AI 智能体基准测试 FrontierFinance 中,Gemini 3.6 Flash 取得了 46.3% 的成绩,超越了 Claude Opus 4.8,并与 GPT-5.6 Sol 持平。
该模型在展现前沿级准确率的同时,极具效率优势:单次查询成本仅为 $2.41,耗时 164 秒,比同级别竞品更便宜且更快。
分析指出,Gemini 3.6 Flash 在挖掘定性见解与上下文理解方面明显优于 Opus 4.8,并在基准测试中最难的“筛选与发现”用例中处于领先地位,非常适合需要兼顾速度、成本和高性能的金融应用场景。
「模型」频道最新
- Anthropic 称网络故障致 Claude 短暂服务降级 — trq212 · 2026-07-31
- 用户吐槽 Claude Opus 频繁且低劣地撒谎 — rickasaurus · 2026-07-31
- OpenAI 被指评测图表刻意挑拣数据 — ns123abc · 2026-07-31
- Agent Arena 智能体榜单更新,Claude Fable 5 登顶 — arena · 2026-07-31
- Sol-5.6 Ultra 模式被指过度思考陷入死循环 — AIandDesign · 2026-07-31
- Claude API默认保留思考块,开发者呼吁OpenAI跟进 — steipete · 2026-07-31