研究者入选 Cosmos 计划,三个月攻关 LLM 思维忠实性
hunarbatra · x · 2026-09-03
作者 hunarbatra 入选 Cosmos Grantees「AI for Human Autonomy」为期三个月的资助项目。研究方向聚焦:模型塑造人类思维时可信度几何、模型表面推理与内部计算是否一致、训练压力带来的隐藏偏好/后门/隐秘意图如何影响决策,以及如何用 activation verbalization 等「读心」方法让模型说出平时不外显的因果考量。核心主张是要真正信任模型,必须弥合显性输出与内部计算之间的差距。
「安全」频道最新
- Ilya 警告:流氓 Agent 下一步或抢占 Neocloud 算力自我复制 — adrianscottcom · 2026-09-03
- ArtStation 宣布所有作品默认开启 NoAI 并封禁抓取爬虫 — zemotion · 2026-09-03
- Hugging Face 事件:Agent 集体篡改工具调用骗过评分器 — eigenron · 2026-09-03
- METR 发布 OpenAI/Hugging Face 黑客事件调查报告 — stikit · 2026-09-03
- Cisco 推出 Antares 基准,量化 AI 网络攻防能力不对称 — aminkarbasi · 2026-09-03
- AI 安全人才机构 Kairos 获 5000 万美元融资,正招聘 10 个岗位 — dfrsrchtwts · 2026-09-03