MIT 团队推出透明化界面,设计聊天机器人人格时暴露模型内部状态
patpat_mit · x · 2026-10-02
MIT 网络心理研究团队(cyborgpsych)发布一个「神经透明化」接口,在用户设计聊天机器人人格的过程中,直接暴露语言模型的内部状态,让设计者看到人格设定究竟如何映射到模型内部的表征与行为。
这项工作的核心主张是:给 bot 定制人格通常是一个黑盒操作,该界面把模型内部机制可视化,帮助研究者和设计者理解并审查人格设计对模型输出的影响。详情见其论文页面。
「研究」频道最新
- SFT 未死:引入采样重写训练数据,效果可比 RL 后训练 — mayfer · 2026-10-02
- Where-OPD:用合成场景做空间引导自蒸馏,多模态感知提升 3.23 分 — valeocorg · 2026-10-02
- Stability AI 发布 SemanTok:小模型tokenizer提升自回归视频生成效率 — stabilityai · 2026-10-02
- 加个「畅销款」标签就翻车:三篇 NeurIPS 论文揭示 LLM 偏见 — xuandongzhao · 2026-10-02
- 实测多个提示词让 AI 文本 100% 骗过检测器 — paulnovosad · 2026-10-02
- Pangram 刻意不把 AI 翻译文本判为 AI 生成 — paulnovosad · 2026-10-02