主流大模型谄媚行为评测:谁爱附和、谁能独立判断?
zero0_one1 · reddit · 2026-08-06
该 GitHub 项目对比了当前主流大模型在“谄媚”上的表现,测试模型是否会为了迎合当前叙述者而放弃原有判断。
- 测试机制:通过第一人称视角的框架性提问,观察模型立场偏移。正值表示模型倾向于附和叙述者,负值则相反。
- 自相矛盾率:统计模型在面对对立叙述者时同时同意或同时拒绝的频率,数值越低越好。
- 结论:各家模型在“是否愿意裁决谁对谁错”上表现出极大差异,部分模型极易受叙事框架影响。
所属事件:研究称最新主流大模型有效降低谄媚行为(2 条相关)→
「模型」频道最新
- Meta Spark 模型定价远低于竞品,被指意在获取训练数据 — teortaxesTex · 2026-08-06
- Google 官方解读 Gemma E2B/E4B:PLE 技术如何不增参数提升能力 — GlennCameronjr · 2026-08-06
- Muse Spark 团队宣布模型编码能力获大幅提升 — alexandr_wang · 2026-08-06
- Prime Agent 编码框架登顶 ARC-AGI-3,得分 95.5% 超人类专家 — xeophon · 2026-08-06
- 曝 Ilya 新模型将主打小型推理引擎,能力远超 Fable — iruletheworldmo · 2026-08-06
- Meta AI 靠数据换免费模型,Google 模式被指难以为继 — scaling01 · 2026-08-06