LLM 可能过度怀疑
aran_nayebi · x · 2026-07-20
作者认为,近期一个明显趋势是:LLM 变得过于怀疑,这种过度保守反而伤害了它们的表现。
他举了一个数学反例的场景,指出模型本不该在面对一个足以推翻长期猜想的“漂亮反例”时,还非得依赖权威背书才愿意接受;这被他视为模型被训练得过于谨慎的一个例子。
所属事件:GPT-5.5/5.6被指在意识等问题上过度怀疑(4 条相关)→
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11