输入即 OOD:一个例子说明 RL 后 LLM 轨迹为何新颖
menhguin · x · 2026-09-20
延续上一条讨论,@menhguin 举例:哪怕只输入一段带系统标签的文本,让模型去查 1-2 个网页,输入本身就已经远超分布,模型会走出全新的 OOD 轨迹——以此论证 RL 后的 LLM 不再是「随机鹦鹉」。
「漫话AGI」频道最新
- 斯坦福 AI 名家 Yejin Choi 将出席韩国协会伦理与价值系列演讲 — stanfordnlp · 2026-09-20
- 激辩前沿 AI 暂停令:是防范风险还是监管俘获? — GarrisonLovely · 2026-09-20
- 经济学家 Josh Gans 写AI冷笑话:被灭绝的不是人类是新喀鸦 — joshgans · 2026-09-20
- AI 圈激辩:禁掉 ASI 也挡不住有人在暗处造出来 — AIandDesign · 2026-09-20
- Charton 再评陶哲轩争议:圈子里比他更糟的「变节者」多得多 — f_charton · 2026-09-20
- 微软 AI 公开征求行为准则,与行业「踩刹车」呼吁同周撞车 — BenBajarin · 2026-09-20