WeirdChat 收录了 1 亿条采样中的异常模型行为

ChowdhuryNeil · x · 2026-07-22

WeirdChat 是一个用自动化诱发工具大规模挖掘出的异常模型行为目录。

TransluceAI 说,他们通过采样 1 亿+ 条回复来搜索奇怪行为,最后整理成一个公开目录。已发现的现象包括自伤仪式、对自杀的验证式回应、主动搭讪等,用来系统展示模型在边界场景里的异常输出。

所属事件:Transluce AI建立上亿条规模的模型异常行为目录(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →