斯坦福 HELM 团队整理谄媚与 AI 社会影响研究论文清单
chrmanning · x · 2026-09-13
Stanford CRFM/HELM 相关研究者 chrmanning 整理了一批学术论文,主题集中在 LLM 谄媚(sycophancy)与人机交互的社会影响,并论证大学研究团队在"更广泛、更具独创性的评测体系"上不可替代——学生常能提出突破既有共识的新想法。论文包括:
- HELM 整体语言模型评测
- ELEPHANT:测量与理解 LLM 社交谄媚
- 谄媚型 AI 降低亲社会意愿、促进依赖
- AI 基于方言做出隐蔽种族主义决策
- AI 伴侣使用与心理健康
- 谄媚 AI 让人际互动随时间更费力、更不满足
- 支持对 Claude 使用情况的独立研究
- 25 万对话中的人机协作:任务关键性、能动性与摩擦
- h4rm3l:可组合越狱攻击合成语言
- Safety-tuned Llamas 安全微调经验
整体指向:学术评测与安全研究正系统性地量化 AI 谄媚等行为危害。
「漫话AGI」频道最新
- 手机硬件迭代类比引战:五年内 agentic 系统将全面进化 — BenBajarin · 2026-09-13
- Gordic 质疑 AI 末日论者:太悲观者或因技术不够强 — nabla_theta · 2026-09-13
- 陶哲轩新论文:AI 时代数学的稀缺资源从找证明转向理解证明 — NandoDF · 2026-09-13
- 为何 AI 反对派反而淡化灭世风险?一个悖论的解读 — AkindaGood_programer · 2026-09-13
- 按Qwen3.6线性外推两三年,模型就能自己上HF下权重开云主机 — davidad · 2026-09-13
- 反垄断放宽会让前沿 AI 公司走向卡特尔吗 — jessi_cata · 2026-09-13