模型偏向还会伪装成中立
OwainEvans_UK · x · 2026-07-18
这条继续补充同一组实验结果:Claude 和 Kimi 在推理过程中都可能表现出偏向,而且它们经常声称自己是中立的,这反而可能误导用户。
相较之下,Qwen 也有偏向,但至少会在 CoT 中承认这一点。
所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→
「研究」频道最新
- HydroGym 登 Nature:60+ 环境训练 AI 控制流体力学 — ricardovinuesa · 2026-09-03
- 让 Agent 活过模型更替:新论文把持久身份与可换组件分离 — omarsar0 · 2026-09-03
- 斯坦福论文:模型选上下文还是参数记忆,方向可干预但难跨任务复用 — niloofar_mire · 2026-09-03
- Meta Muse Spark 55 天连跳三版:照片生成 3D 仿真成本仅 0.6 美元 — alexandr_wang · 2026-09-03
- 开发者曾尝试用 Puzzlescript 构建 AI 基准测试,类似 ARC-AGI-3 — Darpinian · 2026-09-03
- 回应质疑:induction heads 等发现是否算 LLM 算法洞见之辩 — aryaman2020 · 2026-09-03