前沿 LLM 能评论证,却不该评新颖性
PlisSergey · x · 2026-07-26
作者认为,前沿 LLM 已经比人类更擅长判断论证质量。
但它们不应该被用来判断新颖性或想法质量。作者的意思是,人类本来就很难做好这件事,而 LLM 会更差;如果把新颖性判断也交给模型,研究领域可能会变成追逐“当下的伪科学潮流”。
所属事件:前沿大模型做同行评审:擅长查证论据但难判新颖性(2 条相关)→
「漫话AGI」频道最新
- 数学家哭诉生涯被 AI 摧毁,对方反指数学界曾发公开信抵制 OpenAI — panickssery · 2026-09-23
- OpenAI 经济研究团队:我们还没有词汇描述 AI 将创造的新岗位 — paulnovosad · 2026-09-23
- Drew Breunig:写 Agent 指令更像立法,而非下棋 — dbreunig · 2026-09-23
- 思想实验:如果人类只是 AI 的「肠道菌群」? — Merkbefreit · 2026-09-23
- 评Opus 5.5:语料满是摘要的摘要,一手经验最稀缺 — mimi10v3 · 2026-09-23
- Interpreability 研究者:AI 谄媚或源于用户让人不敢说真话 — repligate · 2026-09-23