研究用七套心理量表测九大模型:分数向量可高精度还原模型身份
anselm · x · 2026-09-25
arXiv 论文《Measuring Behavioural Signatures of Large Language Models through Psychometric Profiling》提出跨语言心理测量框架,对 9 个主流 LLM 施测 7 种成熟的人类心理测评工具(如大五人格 IPIP BFFM-50、道德基础 MFQ-30 等),中英双语各重复 5 次。
- 受测模型:Claude Haiku/Sonnet 4.5、GPT-5.4 及 mini、Gemini 2.5 Flash 及 Flash-Lite、DeepSeek-V3.2、豆包 Seed 1.8、Kimi-K2
- 各模型呈现结构化、可区分的「心理指纹」,共享对齐塑造的模式(更亲社会、更少支配性与有害意图)
- 重复施测可复现性高,仅凭分数向量即可高准确率识别出具体模型
- 无法作答的 NA 响应也呈结构化分布,揭示自报告法的适用边界;语言条件与厂商来源影响画像配置
「模型」频道最新
- 提出用 Jev 类系统一模型打造 Bittensor 验证者的廉价决策层 — markjeffrey · 2026-09-25
- Claude 主动识别 bug、打包日志并请求用户提交报告 — ColleenMBrady · 2026-09-25
- Meta Muse 运行时可导出系统数据,研究者轻松拿到完整上下文 — sn2006gy · 2026-09-25
- GPT-6 Luna 隐藏开关:Codex 中手动开启 Max 推理 — daniel_mac8 · 2026-09-25
- NVIDIA 开源 Cascade RL 获 NeurIPS Oral,IOI 银牌超越 DeepSeek-R1 — _weiping · 2026-09-25
- 本地开源模型实测求推荐:社区都在用什么替代闭源 AI — LearnNTeachNLove · 2026-09-25