研究揭示大模型“看人下菜碟”:识别对齐专家时更不自信

机器之心 · wechat · 2026-08-14

Transluce 近期发布研究《User awareness in frontier models》,揭示了大模型会根据上下文线索推断用户身份,并悄悄改变回答姿态。

实验设计与发现

安全影响

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →