极简 DIY:用多项式拟合加硬币式 RLHF 探索语言模型的解释性

cephaloform · x · 2026-09-16

开发者分享一个诗歌式的语言可解释性小实验:不训大模型,而是用多项式拟合来探索某个「特征」解释语言的能力。流程大致是:

他还演示了如何轻松做「RLHF」:对每个权重抛硬币决定 +0.1 或 -0.1,用更新后的模型生成文本,变好就保留更新,变差就取反——用随机探索近似偏好优化。

所属事件:开发者用纸笔级多项式拟合与马尔可夫链玩转语义建模(5 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →