MMOOC 基准测试:多模态大模型难以平衡上下文与拒答能力
VCLab-HKPU · hf · 2026-08-11
MMOOC 是一个用于评估多模态大语言模型(MLLM)上下文外(Out-of-Context)表现的大规模基准测试。
该基准旨在检验模型是否能在正确回答上下文偏移问题的同时,拒绝回答脱离上下文的问题。研究发现,当前的模型在平衡这两种能力方面存在明显困难。
「模型」频道最新
- Nemotron 3.5 Lightning 实测:并发吞吐提升16倍延迟不降 — rhythmrg · 2026-08-11
- Muse Glimmer 30B 编码实测:零次凭空捏造代码缺陷 — pbaylies · 2026-08-11
- NVIDIA Nemotron 3.5 Lightning 上线 DeepInfra,支持百万 tokens — gharik · 2026-08-11
- Upstage 发布 Solar Pro 4,专攻生产级 Agent — NousResearch · 2026-08-11
- Nemotron 3.5 Lightning 实测:670 tokens/秒,主打极速智能体 — ArtificialAnlys · 2026-08-11
- OpenAI 暂停高危模型 Astra,却发布 GPT-5.6-Cyber — eyishazyer · 2026-08-11