17 个主流 LLM 在随机数测试里几乎都选 7
chaseleantj · x · 2026-07-22
一项对 17 个主流 LLM 的对比显示,它们的回答分布高度塌缩,和人类并不相似。
研究者让模型回答“从 1 到 10 随机想一个整数”,人类最常选 7,大约占 33%;LLM 也偏向 7,但程度极端得多,平均 98.1% 的回答都是 7。测试方式是每个模型在默认 temperature、最低思考级别下独立回答 100 次;其中 Grok 4.3 相对最“分散”,但也仍有 83% 选择 7。
「模型」频道最新
- Google DeepMind 发布 Gemini 3.5 Flash-Lite 并接入 Search — dipanjand · 2026-07-22
- Nemotron 在 IMO 2026 拿到 30/42 的金牌水平 — kuchaev · 2026-07-22
- GPT-6 被指不远了,OpenAI 押注定制芯片和更快推理 — haider1 · 2026-07-22
- 美国开源模型生态落后于中国,但竞争有利于创新 — sudoraohacker · 2026-07-22
- 英伟达 Ultra 模型实测:可处理大型代码库与超长工具链 — MonaJalal_ · 2026-07-22
- DeepSeek 推理系统与 545% 理论利润率分析一起曝光 — teortaxesTex · 2026-07-22