生物学研究摘要从不兑现承诺,LLM 幻觉问题雪上加霜
anshulkundaje · x · 2026-09-26
对上条的补充讨论:在生物学领域,模型幻觉问题尤其突出,因为生物学研究本身就「没有哪篇研究真正兑现了摘要里的说法」——在存在多种相互矛盾解释的场景下,这些研究根本行不通。言下之意:一个领域的文献质量本身有系统性偏差时,在其上训练或检索的 LLM 只会放大问题。
「模型」频道最新
- Agent Arena 帕累托前沿:DeepSeek V4.1 单任务6美分,国产模型霸占低价区间 — arena · 2026-09-26
- GPT-6 Sol 登 Agent Arena 榜第6,成本仅竞品44%改写性价比前沿 — arena · 2026-09-26
- TypeSafe 发布决策型模型 Jev:不生成文本,直接输出可执行决策 — hwchase17 · 2026-09-26
- Agent Arena 完整榜单:Claude Fable 5.1 居首,累计评测超200万会话 — arena · 2026-09-26
- Matt Shumer 称 Opus 5.5 自作主张在其网站里藏直升机彩蛋 — mattshumer_ · 2026-09-26
- 一个两栖动物问题就能识别模型评测:研究者提出 spurious probe — AdtRaghunathan · 2026-09-26