Owain Evans 研究:文档中从不提 AI 的角色也能塑造模型「助手人格」
OwainEvans_UK · x · 2026-09-16
Owain Evans 团队研究的进一步结论:Assistant 的人格可以被文档中以极具体的方式塑造——即使这些文档从未提及 Assistant 或 AI(不同于需要提及 AI 的 Persona Selection Model)。模型会从与自己相似的人类角色中吸收更多特质,例如把 Assistant 视为更接近精英学校背景的人。作者指出尚不确定这些基于微调的发现能在多大程度上推广到真实预训练/后训练流程,并将其列为未来工作。
所属事件:研究:从未提及 AI 的文档也能塑造模型人格(2 条相关)→
「安全」频道最新
- 学者拒绝 AI 实验室高薪:独立评估专家稀缺威胁 AI 评测生态 — RishiBommasani · 2026-09-16
- AI 治理需要民主审议,但离不开独立的专家生态 — RishiBommasani · 2026-09-16
- 论文:预训练语料中多谈对齐,错位率从 45% 降至 9% — TuhinChakr · 2026-09-16
- 别设「独立评估员」,直接按营收比例罚款 AI 公司的网络犯罪 — beenwrekt · 2026-09-16
- OpenAI 招人专建生物风险评估,公开征集专家意见 — anshulkundaje · 2026-09-16
- 周末造出无审查语音聊天机器人,作者警示护栏形同虚设 — Lopsided-Bridge-9810 · 2026-09-16