模型测试验证超人类,却拙于探索构思,成科研应用短板
soumitrashukla9 · x · 2026-10-10
@petergostev 观察到:当前模型在测试与验证环节超越人类,但这让它们在探索与构思上反而更差——它们倾向于抓住一个尚可的想法反复验证,而不是发散式寻找新方向。这是模型应用于科学研究的一大阻碍;他推测 Bell(指 Bell Labs 风格的探索式研究)相关的结果或许在此方面表现更好。
「模型」频道最新
- 微软入局决策模型:Decision-1 基于 Qwen3.5,延迟仅 85ms — The Decoder · 2026-10-10
- OpenAI 仅 30 TPS?开发者称本地 Qwen 速度已可追平官方 API — drdanielbender · 2026-10-10
- Brad Wardell 称 Opus 5.5 发布后似乎变得更聪明了 — draginol · 2026-10-10
- 阿里云停服 DeepSeek/Kimi/GLM/MiniMax,开发者被迫迁向 Qwen — pstAsiatech · 2026-10-10
- 集合论专家点评 OpenAI 新解:这水平投期刊会被直接拒稿 — burny_tech · 2026-10-10
- Cloudflare 开源 Clef 决策模型:2.2 秒分类快 gpt-oss-120b 一倍 — dl_weekly · 2026-10-10