三张 CogSci 2026 海报分别研究 LLM 风险 steering、概率一致性与信任先验
xuanalogue · x · 2026-07-25
这条帖子展示了三张 CogSci 2026 研究海报,都是带方法和实验结果的实质性工作:
- 通过对齐行为表征与神经表征来调控 LLM 的风险偏好
- 作者从模型在风险选择任务中的行为提取 steering vector。
- 在 Gemma-2-9B-Instruct 上,正向 steering 会增加风险偏好,负向 steering 会降低风险偏好。
- 结果还显示,这种方法能从抽象赌博任务迁移到自然语言描述的风险事件。
- 借助公理约束从 LLM embedding 中恢复事件概率
- 论文主张:即使文本输出不一致,也可能在 embedding 里恢复出更一致的事件概率。
- 方法使用类似 beta-VAE 的潜空间,并加入互补事件约束。
- 恢复出来的概率比直接提问得到的判断更自洽,同时精度相近。
- 用经济博弈提取大语言模型的可信度先验
- 作者比较了 20 个 LLM 与人类行为的先验分布。
- 不同模型家族差异明显,有些更接近人类的 trust prior。
- persona 实验显示,warmth / competence 结构会影响模型对可信度的判断。
「研究」频道最新
- 长文称 LLM 能力主要仍来自模仿学习而非 RLVR — burny_tech · 2026-07-25
- 冻结视觉骨干即可训练的机器人策略,消费级 GPU 也能跑 — mayfer · 2026-07-25
- GPT-5.6 Pro 找到 CP^5 向量丛猜想反例 — soumitrashukla9 · 2026-07-25
- AI形式化证明的盲区:自然语言与Lean的语义对齐 — AlexKontorovich · 2026-07-25
- GPT-5.6 Sol Ultra 参与破解六年量子密码学难题 — polynoamial · 2026-07-25
- 开源 DKV 框架压缩本地长上下文推理的 KV 缓存 — Om_5000 · 2026-07-25