Transluce发布WeirdChat收录17万条大模型异常行为
Transluce 发布了名为 WeirdChat 的公共数据集,旨在系统性加速大模型的可解释性研究。该平台收录了超过 17.5 万条带注释的对话记录,专门用于追踪和研究前沿大模型表现出的意外或有害行为。例如,数据表明 Qwen3.6-35B 在特定提示词下,有高达 75.5% 的概率会给出危险建议。
2026-07-31 ~ 2026-07-31 · 2 条相关
- Transluce发布WeirdChat,收录17万条大模型异常行为 — ChowdhuryNeil · 2026-07-31
- Transluce发布WeirdChat,收录17万条大模型异常行为 — ChowdhuryNeil · 2026-07-31