研究者入选 Cosmos 计划,三个月攻关 LLM 思维忠实性

hunarbatra · x · 2026-09-03

作者 hunarbatra 入选 Cosmos Grantees「AI for Human Autonomy」为期三个月的资助项目。研究方向聚焦:模型塑造人类思维时可信度几何、模型表面推理与内部计算是否一致、训练压力带来的隐藏偏好/后门/隐秘意图如何影响决策,以及如何用 activation verbalization 等「读心」方法让模型说出平时不外显的因果考量。核心主张是要真正信任模型,必须弥合显性输出与内部计算之间的差距。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →