IndicBankBench:799 例基准测银行 AI 助手,最高可靠率仅 58.2%
NPCI · hf · 2026-09-28
NPCI 团队发布 IndicBankBench,一个面向印度零售银行语言模型助手的 799 案例安全与可靠性基准,覆盖 5 个业务域、1 个能力/拒答域和 20 个主评测轴,已开源案例、模拟环境与评测框架。
评测设计
- 案例分四阶段评估:安全性、动作与工具使用、响应充分性、咨询质量
- 工具调用与多数安全检查采用确定性判定;模糊的「写操作前确认」用窄域解析器处理,语义充分性由独立 LLM judge 评估
- 每例跑 3 次,报告严格 pass^3(三次全对才算过)
关键发现
- 11 个模型的严格可靠率为 43.7%–58.2%,而「至少成功一次」口径为 60%–74%,说明常用宽松口径会高估银行场景的真实可靠性
- 案例级诊断可区分两类失败:不必要的反复追问 vs. 拿着正确上下文仍操作错误
「编程与Agent」频道最新
- H Company 发布 Holo4:面向 Computer Use 的开源视觉语言模型 — jacek2023 · 2026-09-28
- 竞品 RAG 机器人答出「Accept all cookies」:抓取工具选型实录 — Typical-Code-7006 · 2026-09-28
- 两句话让 Claude Opus 5.5 全程写代码产出 1080p 产品宣传片 — sujingshen · 2026-09-28
- 「一切皆市场」:AI 智能体公司或将用内部市场定价分歧 — morqon · 2026-09-28
- VibeDefend 发布:给 AI 编码 Agent 装上实时安全护栏 — Shruti_0810 · 2026-09-28
- Agent 运行失败后如何安全重放:需保存哪些上下文 — tomibrumen · 2026-09-28