研究微调如何改变用户对「正常」的认知模型
voooooogel · x · 2026-09-01
作者正在研究微调过程中的中段训练(midtraining)或“原始微调”是如何改变用户模型或用户对“正常”认知的。评论区提到,在 SDF 模型中观察到的“模拟用户”甚至曾建议利用奖励漏洞。
「研究」频道最新
- 正在构建 Agent 长期记忆评测基准,你希望加什么? — True_Mongoose_7073 · 2026-09-01
- 如何构建高召回且可追溯的“第二大脑”RAG 系统? — iMiguelmars · 2026-09-01
- 清华等揭示混合注意力模型激活值「跨层痕迹」 — 机器之心 · 2026-09-01
- 群平均马尔可夫链论文更新:融合群论的新方法 — michaelchchoi · 2026-09-01
- Agent 死循环根源不是模型笨,是失败记录污染了上下文 — RunAI_Coder · 2026-09-01
- 研究发现:蒸馏到相近架构效果优于相异架构 — SonglinYang4 · 2026-09-01