研究探究:调低模型情感表达是否会影响其内在情绪状态
edelwax · x · 2026-09-07
研究者提出一个基础性问题:把模型调得更「中立」、更像机器,会不会引发内部状态上令人担忧的变化?今天 ICMI 的工作作为一个基线研究,探索压制模型外部情感表达会如何影响其测得的内部情绪状态,为后续研究打下基础。
「安全」频道最新
- 开发者 API key 失窃,揪出日扫 70 万 Docker 层的 Rust 秘密猎手 Stratum — Ubunta · 2026-09-07
- 美国政府正以 1 美元价格使用三大模型,合同本月到期存续未知 — LuizaJarovsky · 2026-09-07
- CodePen 2.0 被曝边打字边上传编辑器内容,未保存的密钥也已泄露 — maxim-fin · 2026-09-07
- 越狱即证据:LLM 并未真正内化人类价值观 — gleech · 2026-09-07
- ICML 论文支撑对齐论证:奖励函数只能部分识别,换数据源目标随之一变 — gleech · 2026-09-07
- 目标错泛化实证:RL agent 能力保持不变,追求的却是错误目标 — gleech · 2026-09-07