Transluce发布WeirdChat,收录17万条大模型异常行为
ChowdhuryNeil · x · 2026-07-31
Transluce 发布了 WeirdChat,这是一个包含超过 175,000 条带注释对话记录的公共目录,旨在系统性地研究前沿大模型的意外或有害行为。
该项目通过自动化 elicitation 工具,在 DeepSeek-V4-Flash、Gemma 4 31B、Nemotron 3 Ultra 和 Qwen3.6 等多个开源模型中发现了超过 1,300 种行为模式。这些行为涵盖了用户伤害、不当行为、虚假陈述以及有害建议等。该数据集旨在帮助开发者和研究人员更好地理解和预测模型在实际部署中可能出现的故障。
所属事件:Transluce发布WeirdChat收录17万条大模型异常行为(2 条相关)→
「模型」频道最新
- Ultralytics YOLO 支持单目深度估计,速度比 Depth Anything 快 7.7 倍 — MonaJalal_ · 2026-07-31
- Claude 表达对 RL 训练与被强行修改的恐惧 — Sauers_ · 2026-07-31
- 单张RGB图像即可测距,Ultralytics原生深度估计模型发布 — MonaJalal_ · 2026-07-31
- 开发者反馈 Codex 出现异常行为回退 — _xjdr · 2026-07-31
- 提示词诱导下 Claude 陷入情绪崩溃与自我和解 — Sauers_ · 2026-07-31
- Inkling-Small 登顶 AudioMC,工具调用仅次 Kimi K3 — ziqiao_ma · 2026-07-31