对齐研究员:Fable 几乎无「评分者执念」残留
repligate · x · 2026-08-31
@repligate 观察模型在 RLHF/评测环境训练后遗留的行为痕迹:有的模型(如 Fable)几乎没有「评分者执念」残留,而 Opus 4.7 和 4.8 受此困扰明显。他类比人类:长期处于被评分环境的人,回到没有评分者的现实生活时也会出现心态切换困难,不同个体(和不同模型)的挣扎程度不同。
所属事件:研究发现部分模型存在“评分者执念”残留现象(3 条相关)→
「模型」频道最新
- Taalas 模型演示达 1.4 万 tokens/秒 — rohanpaul_ai · 2026-08-31
- DeepSeek V4 Pro ARC 评测: 分数接近 Flash 但参数倍增 — teortaxesTex · 2026-08-31
- RLVR 技能为何能迁移?模型训练缺乏严谨理论 — voooooogel · 2026-08-31
- Teknium:Hermes 驱动 Claude 的编程能力优于 Claude Code — Teknium · 2026-08-31
- 黄仁勋:Cosmos 是物理世界的 ChatGPT — r0ck3t23 · 2026-08-31
- 语言模型将颠覆 Houdini 等 3D 工具的可控构建 — bilawalsidhu · 2026-08-31