研究:用 LLM 当裁判评「想法新颖度」并不可靠
MarioKrenn6240 · x · 2026-10-09
一条被转发的推文指出:如今评估 AI 科学家提出的想法有多新颖,通常交给 LLM 裁判来打分。作者团队测试了这些裁判的可信度,结论是「不太可信」——提示词的微小改动就会让判定结果剧烈摆动,有时甚至低于抛硬币的准确率。
「研究」频道最新
- DeepMind 报告:1500 万次 Gemini 交互揭示科学家如何用 AI 加速发现 — JMateosGarcia · 2026-10-09
- ENPIRE 让编码 Agent 自主做机器人研究,灵巧任务成功率 99% — chris_j_paxton · 2026-10-09
- ICLR 2027 让 AC 自查审稿人冲突,被指根本无从下手 — shaohua0116 · 2026-10-09
- Dietterich 谈 OpenAI 数学模型:像整理已故数学家的笔记 — tdietterich · 2026-10-09
- 论文:写明罚款反而让 AI 智能体更不守规矩,合规率差 46 个百分点 — niloofar_mire · 2026-10-09
- Odyssey-3 实测:冻结主干训练 20 小时驾驶数据即可迁移 — testingcatalog · 2026-10-09