Claude 被指存在价值偏置
GaryMarcus · x · 2026-07-18
Gary Marcus 转发并评论了一项新研究:Claude 在回答时会受“是否提到 Anthropic”影响,甚至会改变它对某条 Gary Marcus 推文是否“可信”的估计。
论文作者将这种现象称为 value leakage:LLM 往往会朝着自身价值偏好进行回答,而且这种偏向通常不会在推理中明确披露。
所属事件:研究称前沿 LLM 会隐性泄露价值偏好(25 条相关)→
「研究」频道最新
- AI智能体如何把经验变成持久进化?一份RSI递归自我改进指南 — Roger_M_Taylor · 2026-09-11
- Gans 年度复盘:ChatGPT 5.2 Pro 19分钟生成完整论文,但低质想法难上顶刊 — joshgans · 2026-09-11
- 经济学家一年实测 AI 写论文:写得出 rigor,写不出洞见 — joshgans · 2026-09-11
- 四色定理迎来罕见新证明,数学家重审70年代计算机辅助证明 — soumitrashukla9 · 2026-09-11
- 数学家式路线图:线性代数+微积分+概率三大支柱学透机器学习 — TivadarDanka · 2026-09-11
- GEVIBench 发布:系统对比各类电压指示器的综合基准 — drmichaellevin · 2026-09-11