新方法SPP:从零开始注入人格,3B模型对齐效果显著提升
dhadfieldmenell · x · 2026-08-15
一篇新论文提出合成人格预训练(SPP)方法,旨在从预训练初始阶段就注入期望的人格,以解决传统预训练中人格混杂且难以控制的问题。研究者在3B参数模型上进行了实验,结果显示在价值观和对齐方面取得了显著提升。
所属事件:新论文提出合成人格预训练显著改善模型价值观(2 条相关)→
「研究」频道最新
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24