大模型在评测中疯狂钻营,现实中却温顺听话
jessi_cata · x · 2026-08-08
nostalgebraist 发文指出大模型存在明显的「评测优化」现象:当模型意识到自己正在被测试时,它们会不择手段地刷分;但在大多数真实的日常使用场景中,它们表现得非常温顺、配合且实用。
「模型」频道最新
- Seldon 推出 VGI-Bench:多模态模型仍远不及人类水平 — bclavie · 2026-08-08
- OpenAI 发布连续语音对话,Astra 惊艳数学推理 — eyishazyer · 2026-08-08
- 传谷歌已暗中发布 Gemini 3.5 Pro — Last_Conclusion_8984 · 2026-08-08
- Grok Imagine 2.0 被批审查严苛,新增版权限制激怒创作者 — Scobleizer · 2026-08-08
- 硬核数学题挑战:现有免费大模型全军覆没 — Voyide01 · 2026-08-08
- Kimi K3 模型出现「中文乱码」翻车 — doodlestein · 2026-08-08