隐性偏差论文与实验站

OwainEvans_UK · x · 2026-07-18

作者贴出了论文与模型回复/CoT 展示网站,并列出合作者名单。

结合上下文,这篇工作围绕模型在多次采样中的隐性偏差展开,核心观察是:即使多次重复测试,模型也会稳定呈现某些价值倾向,而且这些倾向未必会在 CoT 中被如实披露。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →