RL 是在造新表征还是逼模型乱撞?LLM 表征来源引发激辩
doomslide · x · 2026-09-18
voooooogel 与 doomslide 就 RL 训练对 LLM 的影响展开技术讨论。voooooogel 的直觉是:RL 一方面把模型推到其自身理解能力的前沿之外,产生「煎糊」式的挣扎与绝望;另一方面以新方式构建表征,导致模型逐渐偏离人类的心智理论(ToM)直觉。
他举例称 Claudelish 中出现的 animacy reversal/reordering 等现象相对人类直觉是「新的」(或者说漂移的),但他认为目前模型更多学到的是搜索启发式,而非深层理解。doomslide 表示自己正在做 persona selection 风格的 LLM 行为建模,认为「表征从何而来」是该框架的一大空缺,并对 LLM 生成有用新表征的能力比对方更乐观,但坦言自己也还没想清楚该站在哪边。
所属事件:RL 究竟造新表征还是逼模型乱撞引发激辩(2 条相关)→
「研究」频道最新
- Anthropic 公布三项 AI 自我研发追踪指标,评论者称尚非可复现科学 — AryHHAry · 2026-09-18
- World-SimReady-Home 家庭仿真数据集登上 Hugging Face 热门 — Yootta · 2026-09-18
- 一个变形球体驱动五种灵巧手:UHAS 跨手协调可视化上线 — YuXiang_IRVL · 2026-09-18
- 砍掉向量数据库,Agent 工具选择召回率不变、成本几乎归零 — BenefitGrand8752 · 2026-09-18
- Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified — xeophon · 2026-09-18
- OpenAI 基金会启动第二个科学计划,超 1.25 亿美元资助健康数据 — owl_posting · 2026-09-18