探讨小模型评测:选择题测试易作弊
mervenoyann · x · 2026-07-14
AI 研究员 Merve Noyant 指出,在评估大模型时,多数多选题评测(MCQA)实际上容易让模型“作弊”:即使模型陷入循环或胡言乱语,多选题的选项结构也能帮助其梳理并锚定答案。因此她更倾向于喜欢研究小模型,并强调进行“氛围测试”(vibe test)的重要性。
「研究」频道最新
- 把数据集打包成顺序 blob,训练吞吐提升 30% — irinarish · 2026-07-21
- Silico 被形容为异步长周期实验 — Sauers_ · 2026-07-21
- Silico 删掉 Fable 交互后变差,但仍能快速迭代 — Sauers_ · 2026-07-21
- 一个 C++20 CPU 原生 strict-W1 训练 runtime 寻求反馈 — Wonderful-Income7415 · 2026-07-21
- 微软提出像训练神经网络一样训练 agent 技能 — Saboo_Shubham_ · 2026-07-21
- 研究者:AI 应是放大器,而不是放弃科研的理由 — omarsar0 · 2026-07-21