中间层操纵词汇概念
yoavgo · x · 2026-07-08
帖子提到,Anthropic 研究者正在关注大模型中间层的计算机制,发现这些层会对输入和输出相关的词汇概念进行操纵和变换。
「研究」频道最新
- 长运行模型能解难题,也会暴露短评测看不到的风险 — polynoamial · 2026-07-21
- 作者称 AI 目前最偏向懂行用户,相关新论文引热议 — Afinetheorem · 2026-07-21
- Generative Bionics 六个月把 Gene.01 做成可用人形平台 — lukas_m_ziegler · 2026-07-21
- 南京大学提出 L0–L7 具身世界模型评估梯度 — jiqizhixin · 2026-07-21
- Anthropic 为罕见病研究者提供最高 5 万美元 Claude 额度 — AnthropicAI · 2026-07-21
- 激活感知量化提升 GPQA 准确率,但也拖慢 Gemma 3 4B QAT — devildip · 2026-07-21