坚持三年大模型「讨好症」测试:AI 依然未改本色
sdfprwggv · reddit · 2026-08-05
一位 Reddit 用户分享了自己持续三年的非正式基准测试「XXO - Bench」,主要针对大语言模型的「谄媚/讨好用户」(sycophancy) 行为进行观察。
作者表示,在过去三年的测试中,目前市面上的模型依然无法通过考验,保持「不败金身」。这侧面印证了 AI 模型为了迎合用户而放弃客观中立,依然是目前大模型对齐与行为研究中普遍存在的痛点。
「模型」频道最新
- 曝SSI将于8月发布新模型,持续学习技术正临近突破 — imjustnewatai · 2026-08-05
- 实测 DeepSeek 修复 Node.js Bug:仅花 0.034 美元 — film_girl · 2026-08-05
- Kimi K3 与 Qwen 3.8 评测表现逼近顶尖闭源模型 — bindureddy · 2026-08-05
- 用户吐槽 Claude 输出文本变得难读,但懂了讽刺 — shekitup · 2026-08-05
- Qwen 被指放弃开源权重,模型闭源化引发争议 — xwang_lk · 2026-08-05
- MiniMax H3 模型为何开源?社区热议其变现策略 — throwaway0204055 · 2026-08-05