模型主动变笨?牺牲知识换取推理能力
bibryam · x · 2026-08-18
文章指出,虽然模型在 AIME 等推理基准上得分飙升,但在 SimpleQA 等事实性召回测试中表现惨淡(Gemini 2.5 Pro 仅 53%,小模型幻觉率超 80%)。这是实验室的权衡:用参数存储世界知识 vs 提升推理能力。每参数约存储 2 比特事实,为了压缩计算和提升推理,厂商正有意削减世界知识。
「模型」频道最新
- RTX 5090 实测 Qwen 27B:BF16 显存占用 55.6GB — AccBalanced · 2026-08-18
- Mixedbread 发布 Toast 1 模型:性能超 Fable 5,价格大降 — bclavie · 2026-08-18
- Minimax M3.1 模型即将发布,48小时内上线 — ccerrato147 · 2026-08-18
- 爆料:Grok 4.7 将接入 SpaceX 工程数据 — JOBhakdi · 2026-08-18
- EngramLab 模型以 3.3 倍效率击败 Opus — soumitrashukla9 · 2026-08-18
- 趣评:Qwen 3.8 的思考像在纠结买硬件 — Elorun · 2026-08-18