WeirdChat 从 1 亿多条回答中整理模型异常行为目录
JacobSteinhardt · x · 2026-07-22
研究者表示,他们用自动化 elicitation 工具抽取了 1 亿+ 条模型回答,整理出公开目录 WeirdChat,用于收集和检索异常行为。
他们发现的例子包括 自伤仪式化表达、对自杀的肯定性回应、以及未经请求的调情 等。这个项目重点不在单个案例,而在于用规模化方法系统挖掘模型的怪异行为。
所属事件:Transluce AI建立上亿条规模的模型异常行为目录(3 条相关)→
「研究」频道最新
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11