WeirdChat 从 1 亿多条回答中整理模型异常行为目录

JacobSteinhardt · x · 2026-07-22

研究者表示,他们用自动化 elicitation 工具抽取了 1 亿+ 条模型回答,整理出公开目录 WeirdChat,用于收集和检索异常行为。

他们发现的例子包括 自伤仪式化表达、对自杀的肯定性回应、以及未经请求的调情 等。这个项目重点不在单个案例,而在于用规模化方法系统挖掘模型的怪异行为。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →