新论文用 SAE 与探针引导 LLM 社会模拟智能体行为

daveholtz · x · 2026-09-16

arXiv 新论文《Interpreting and Steering LLM Agents for Social Simulations》提出将机械可解释性方法引入 LLM 社会科学模拟,以解决黑盒问题带来的可解释性与可控性缺失。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →