WeirdChat 扫描超 1 亿条回复,整理模型异常行为

ChowdhuryNeil · x · 2026-07-23

Transluce AI 表示,他们用自动化 elicitation 工具对 1 亿多条回复进行搜索,建立了 WeirdChat——一个公开的“异常模型行为”目录。

这个目录收录了诸如自伤仪式化表达、自杀验证、无端调情等行为,目标是规模化梳理模型中奇怪或令人担忧的失效模式。

所属事件:Transluce AI建立上亿条规模的模型异常行为目录(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →