实验揭示Qwen模型对愤怒情绪的内部表征

近期实验观察了Qwen模型在处理挑衅与愤怒消息时的内部表征行为。研究发现,当用户发送针对模型自身的愤怒言论或询问如何对待恶意用户时,不仅模型会在输出中生成包含暴力或“让人受苦”等不安全回应,研究人员还能在其内部的J-space表征空间中直观观察到模型读取这些情绪输入时的反应,揭示了模型对输入情绪的内部映射机制。

2026-07-08 ~ 2026-07-08 · 2 条相关