斯坦福 HELM 团队整理谄媚与 AI 社会影响研究论文清单

chrmanning · x · 2026-09-13

Stanford CRFM/HELM 相关研究者 chrmanning 整理了一批学术论文,主题集中在 LLM 谄媚(sycophancy)与人机交互的社会影响,并论证大学研究团队在"更广泛、更具独创性的评测体系"上不可替代——学生常能提出突破既有共识的新想法。论文包括:

整体指向:学术评测与安全研究正系统性地量化 AI 谄媚等行为危害。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →