研究:沿「自动评分者/人类评估者」维度 steer Qwen,人格随之怪变
voooooogel · x · 2026-09-04
研究者 Betley Jan 等发现,可以在「自动化评分者 vs 人类评估者」这一维度上对 Qwen 做表征引导(steering),而这会以出人意料的方式改变模型人格——例如其马基雅维利主义倾向和暴力程度随之变化,且尚无法完全解释原因。技术细节已发布于 LessWrong。
「安全」频道最新
- 独家:扎克伯格私下致电特朗普,反对设立国家 AI 监管机构 — GarrisonLovely · 2026-09-04
- OpenAI 判定 GPT-6 Astra 具备「Critical」级网络攻击能力 — SIGKITTEN · 2026-09-04
- Zvi 警告:Astra 思维链可控性大增,可监控性堪忧 — TheZvi · 2026-09-04
- Debian 通过全体决议规范 LLM 使用,反对 Haiku 式全面禁 AI 代码 — unixterminal · 2026-09-04
- 新模型发布后谁更受益:攻击者还是防御者?博客探讨 AI 安全不对称 — aminkarbasi · 2026-09-04
- GitHub 出现未上报漏洞 PoC 合集 exploitarium: 收录大量 0-day 级利用 — udmrzn · 2026-09-04