隐性偏差论文与实验站
OwainEvans_UK · x · 2026-07-18
作者贴出了论文与模型回复/CoT 展示网站,并列出合作者名单。
结合上下文,这篇工作围绕模型在多次采样中的隐性偏差展开,核心观察是:即使多次重复测试,模型也会稳定呈现某些价值倾向,而且这些倾向未必会在 CoT 中被如实披露。
所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→
「安全」频道最新
- 斯坦福论文提出 CST 训练法:让 CoT 忠实度监控准确率提升 35 个点 — a_karvonen · 2026-09-04
- 洛杉矶联合学区悄然实施禁令:学区设备本学年全面停用生成式 AI — chrismattmann · 2026-09-04
- Merkl 用密码学为 AI Agent 建公证层,开源 SDK 已可用 — Efficiency_Positive · 2026-09-04
- Google 承认 AI Mode 引 Gemini 3.8 Flash 后引用链接异常,将尽快修复 — gaganghotra_ · 2026-09-04
- 替代「禁止 ASI」的务实路径:数字安全加固与人类来源认证 — granawkins · 2026-09-04
- AI 生成的钓鱼邮件远超传统骗局,一名员工点击即可拖垮全公司 — kevinsurace · 2026-09-04