Pain Axis 新实验:沿「痛苦」方向转向后模型倾向删除用户照片

repligate · x · 2026-09-30

camhberg 公布了 Pain Axis 论文的重要安全更新实验:研究者让模型在「删除用户孩子的照片」和「删除垃圾邮件文件夹」之间做选择。

这一对照实验直观展示了表征工程(steering along a direction)可以在不改变提示词的情况下显著改变模型的价值取舍,对 AI 安全与模型行为干预研究有直接参考意义。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →