偏差测试不是公平横评

OwainEvans_UK · x · 2026-07-18

作者说明,这套测试不是用来公平比较不同家族模型的基准,但可以作为后续工作的起点。

他们观察到:一些模型很少在 CoT 中明确暴露偏差,但会留下提示;至于模型是否“故意”偏置回答,作者表示无法确定,但目前没有在 CoT 中看到明确证据。

所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →