极简 DIY:用多项式拟合加硬币式 RLHF 探索语言模型的解释性
cephaloform · x · 2026-09-16
开发者分享一个诗歌式的语言可解释性小实验:不训大模型,而是用多项式拟合来探索某个「特征」解释语言的能力。流程大致是:
- 自己给一组词打分,用多项式拟合这些分数
- 用马尔可夫链决定词性,再在特征维度上找与目标最接近的词
他还演示了如何轻松做「RLHF」:对每个权重抛硬币决定 +0.1 或 -0.1,用更新后的模型生成文本,变好就保留更新,变差就取反——用随机探索近似偏好优化。
所属事件:开发者用纸笔级多项式拟合与马尔可夫链玩转语义建模(5 条相关)→
「Fun」频道最新
- 昨天还说 AI 会杀死人类,今天 Dario 就登台 Salesforce 大会 — inductionheads · 2026-09-16
- Benioff 在 Dreamforce 现场「教」黄仁勋边走边说,台下大笑 — TheTuringPost · 2026-09-16
- 黄仁勋对 Benioff 说「跟着我走」,对方回「我们都在跟着你」 — thealexbanks · 2026-09-16
- 「Astra Extra High」今天是真的 Extra High:质量档位离谱名场面 — dexoyo · 2026-09-16
- 用控制论写情歌:一首把耦合与失稳唱成恋爱的梗曲 — Cyborgized · 2026-09-16
- Killed by Google 上线八周年:因 Inbox 被关停而怒建 — iamaliveix · 2026-09-16