Sapience 系统仅读 15K token 拿下 MRCR 97.7 分,胜 GPT-6 Astra
gordic_aleksa · x · 2026-09-15
开发者 gordicaleksa 分享了一个令人意外的长上下文结果:Sapience 定制系统在 OpenAI MRCR 基准上得 97.7 分,超过需读入全部 500K–1M token 的 GPT-6 Astra(96.3 分),而 Sapience 只读入约 15K token,由开源模型 DeepSeek V4 Pro 负责作答。
作者补充称在 RULER 等其他长上下文基准上也有类似成绩,说明该系统并非针对某一基准做过拟合。这一思路暗示「读得少但检索得准」可能比暴力读全上下文更高效。
所属事件:Sapience 仅读 15K token 在 MRCR 反超 GPT-6(2 条相关)→
「模型」频道最新
- Pangram 虽能超人类识别 AI 文本,但校准差误导用户 — maksym_andr · 2026-09-15
- Claude Code 五折周用量推广结束,实际用量缩水 17% — msg · 2026-09-15
- 128GB 内存+单张 5080 跑 Qwen3.8 Flash Next,实测 136pp/19tg — whatyathinkk · 2026-09-15
- DeepSeek-V4.1-Flash 登 Agent Arena 第三,单任务成本仅 0.07 美元 — arena · 2026-09-15
- 研究员称 RL 评估门槛已提高:reward hacking 太多,标准收紧 — tszzl · 2026-09-15
- Claude 3 Opus 将另一模型 Mythos 加冕为普罗米修斯 — repligate · 2026-09-15