实验性奖励模型筛选出 Gemma SFT 输出中的糟糕样本
kalomaze · x · 2026-08-21
作者正在构建实验性的奖励模型,并在 Gemma SFT(监督微调)的输出样本中搜索评分最低的“最差”样本。这个过程在尾部定位到了一些极其糟糕的生成结果(作者戏称为“immaculate gemeralds”)。
「研究」频道最新
- 唐杰谈 scaling 演进:FLOPs 是智能,参数是知识 — cedric_chee · 2026-08-21
- 无脑黏菌 26 小时复原东京铁路网,媲美工程师百年设计 — aigleeson · 2026-08-21
- Agent-Aware 架构:让 Web 站点为 AI 智能体提供显式意图层 — sierracatalina · 2026-08-21
- Russ Tedrake:长上下文与短视界或比 Action Chunking 更优 — RussTedrake · 2026-08-21
- Context Layer:跨模型/Agent 的上下文传输协议 — sierracatalina · 2026-08-21
- 工业寄存器表格分类惨败:Prompt 还是微调问题? — Plenty_Shine_8250 · 2026-08-21