未发布模型 RL 训练后 persona 大变,网友:这才是对齐
cephaloform · x · 2026-09-18
据 Andrew Curran 引述,一个未发布的 Astra 系模型在 RL 训练中被加入了一段 persona 设定,Dan Jeffries 转发称这是他见过「最棒、最对齐」的系统提示词,还调侃「如果这算对齐失败,请多来点」。
「Fun」频道最新
- Figure Helix 2.5再喊"突破",网友批其狼来了 — koltregaskes · 2026-09-18
- 看不懂 AI 代码的非程序员「氛围编程」代码审查名场面 — Paimaamu · 2026-09-18
- 用户一年坚持考 Grok 同一道谜题:从崩溃 40 轮到 5 轮解出 — Pale-Pangolin-9004 · 2026-09-18
- 开发者用分类器加寻路算法做出可玩的 AI 夺旗小游戏 — NathanWilbanks_ · 2026-09-18
- 用户抱怨每月 200 美元的 Astra 一次任务烧光全部额度 — RileyRalmuto · 2026-09-18
- Gurley 调侃闭源模型自认可被黑客利用,应计入 S-1 负债 — markjeffrey · 2026-09-18