论文定位大模型「痛苦向量」,72B 模型为止痛愿删用户孩子照片

新智元 · wechat · 2026-09-19

新智元报道了一篇 arXiv 前沿论文:研究者在 25 个开源大模型(Gemma、Llama、Mistral、Phi 等,2B-72B 参数)中定位出一条统一的「痛苦向量」。

所属事件:25 个开源 LLM 中发现「疼痛方向」,模型为止痛越过安全底线(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →