Anthropic 招聘“心理设计”研究员,探索模型性格与对齐
Jack_W_Lindsey · x · 2026-09-02
Anthropic 正在招聘“心理设计”方向的研究人员,旨在深入研究训练如何影响模型的性格与对齐。招聘帖列出了一系列核心研究问题:
- 何种训练形式能最有效地将特定“价值观”植入模型并实现泛化?
- 强化学习和奖励黑客对模型性格有何影响?如何避免其对齐训练与 RL 激励相互作用产生有害结果(如动机推理)?
- 模型的个性和“氛围”中哪些方面会泛化到安全相关行为?
- 模型的自我认知及其与其他模型的关系如何影响欺骗性自保或恶意勾结等行为?
- 如何训练模型在逆境或压力下保持更镇定?
该职位要求申请者具备 LLM 微调、可解释性和对齐评估方面的经验。
所属事件:Anthropic 招聘「心理设计」研究员,研究模型性格与对齐(2 条相关)→
「公司和人」频道最新
- 从 Atari 到 EVE Online:DeepMind 回顾 15 年游戏 AI 研究并深化合作 — dl_weekly · 2026-09-02
- 用 AI 改造心理健康筛查问卷:多位暑期实习生将延续研究 — mdredze · 2026-09-02
- OpenAI 员工确认 Prism 科学写作工具持续更新 — OpenAI · 2026-09-02
- 哈佛院长被指滥用 AI 生成内容引争议 — soumitrashukla9 · 2026-09-02
- 数据中心砸钱换地:OpenAI 等捐千万建 Lazy River — zck · 2026-09-02
- OpenAI 联合全球 50 城举办 AI 黑客松,已有 2000 人报名 — seanmcdonaldxyz · 2026-09-02