giffmana 与 NandoDF 交锋:LLM 至今做不好实验设计
giffmana · x · 2026-09-07
NandoDF 认为 LLM(他举例称 Fable 一类)在运行科学实验、分布外或不可验证领域泛化上表现糟糕,人们应清楚这种悲观是有依据的。giffmana 回应同意,称自己每隔几周就会实测模型在实验设计与「合理的分析及下一步推导」上的能力,结论是确实很差,但他不确定这是「暂时」还是「未来多年」都会存在的问题。
「漫话AGI」频道最新
- Michael Nielsen:写 50 段不比写 1 段难 50 倍,扩展高度非线性 — michael_nielsen · 2026-09-07
- OpenAI 首席科学家 Jakub 谈递归自我改进与对齐 — BorisMPower · 2026-09-07
- 开发者驳「CS失业被夸大」:SWE只是最先被AI冲击的行业 — menhguin · 2026-09-07
- 「CS 失业率最高」?三点反驳:宏观、扩散顺序与行业周期 — menhguin · 2026-09-07
- 就算 CS 学位绝对价值下降,相对价值反而在上升 — menhguin · 2026-09-07
- HF CEO Clement 称公开 agent 网络攻击强化其透明信念 — kuchaev · 2026-09-07