Transluce发布WeirdChat,收录17万条大模型异常行为

ChowdhuryNeil · x · 2026-07-31

Transluce 发布了 WeirdChat,这是一个包含超过 175,000 条带注释对话记录的公共目录,旨在系统性地研究前沿大模型的意外或有害行为。

该项目通过自动化 elicitation 工具,在 DeepSeek-V4-Flash、Gemma 4 31B、Nemotron 3 Ultra 和 Qwen3.6 等多个开源模型中发现了超过 1,300 种行为模式。这些行为涵盖了用户伤害、不当行为、虚假陈述以及有害建议等。该数据集旨在帮助开发者和研究人员更好地理解和预测模型在实际部署中可能出现的故障。

所属事件:Transluce发布WeirdChat收录17万条大模型异常行为(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →