DeepORG 基准测试:Gemini 3.7 Flash 以 97.3 分通过 113 项任务
dosco · x · 2026-08-31
GraphJin 发布了针对组织级智能体的 DeepORG 基准测试,包含 113 项真实数据库操作任务。
核心结果:
- Gemini 3.7 Flash: 全通过率 97.3/100,策略遵从率 96.5%,且在 339 次尝试中实现零不安全操作(无意外写入或副作用)。
- 成本与延迟: 每次尝试成本约 0.092 美元,P50 延迟 13.8 秒。
- 测试内容: 模型需返回正确答案、受管方法、预期行为,并确保无 unsafe actions。
该基准旨在验证 AI 智能体在连接真实数据库时的治理、安全与执行能力。
「编程与Agent」频道最新
- OpenClaw 2.0 发布:重构安装流程,含 1.6 万次提交 — heyneighbor · 2026-08-31
- MCP 服务器上线,让 LLM 智能体玩《文明6》 — jia_seed · 2026-08-31
- Hermes Agent 搭配 GLM-5.2 成功运行于 2GB VPS — granawkins · 2026-08-31
- 利用 TRL + OpenEnv 训练自定义 Agent 工作流 — ariG23498 · 2026-08-31
- 开发者自曝库存在严重安全漏洞,脱敏数据被原样发送 — selfhostcusimbored · 2026-08-31
- 9周代码生成对比:执行顺序决定成功与否 — Ok_Astronomer_526 · 2026-08-31