micro1 发布 CortexRetrievalBench:140 道尽调题考检索排序系统
Exp_Mark · x · 2026-10-03
micro1 推出 CortexRetrievalBench,一个针对金融文档的检索与重排(reranking)系统评测基准。
- 核心场景:企业落地 AI 时,把正确信息以正确顺序喂给模型是最大挑战之一;该基准把金融文档语料与 140 道尽调(diligence)查询配对,每题都绑定应作答的权威来源。
- 评分方式:看系统能否检索到对应文档、并把它排到最前。
- 关键难点:多篇文档看似都能回答同一问题——如现行申报稿与已废止版本、一手来源与二手摘要——测试发现权威文档常未排进头部。
「研究」频道最新
- 扩散模型生成国际象棋谜题:新 RL 配方破纪录,模型开源 — TZahavy · 2026-10-03
- 传统 nDCG 高分仅 53% 获人类认同,RCP-nDCG 提升至 97% — Nils_Reimers · 2026-10-03
- MemFold 用固定预算软记忆加在线优化刷新长程个性化记忆基准 — Jingxuan Wu · 2026-10-03
- AI 智能体离科学家还有多远?研究称其难产真正科学洞见 — typewriters · 2026-10-03
- ezyang 深度解析:用 Roofline 模型在 Hopper 上训练 DeepSeek-V3 — ezyang · 2026-10-03
- 36B 开源机器人模型无本地 GPU 实时运行,物理 AI scaling law 显现 — AkshatS07 · 2026-10-03