研究者直言 activation steering 太粗糙,该学模型内部几何语言
cephaloform · x · 2026-09-24
- 在一场关于「修好 steering 后模型就不工作」的讨论中,研究者认为 activation steering 仍是非常粗糙的手段。
- 其主张:我们应开始用模型「内部语言」与其中的几何结构交互;许多证据已表明线性可分不等于全貌,但学界并未据此充分更新方法。
「研究」频道最新
- OpenRSI 发布递归自我改进评测基准,基于 1k GPU 集群与 60 小时 Agent 轨迹 — ChengleiSi · 2026-09-24
- 浙大 SpeakerMem-R1:多人对话记忆登顶 EverMemBench 榜单 — zju · 2026-09-24
- CMU 发布 WhatWorkedBench:测 AI 研究智能体的实验理解能力 — CarnegieMellonU · 2026-09-24
- 腾讯发布 RewardVerse:Rubric 引导优化解决视频奖励标量漂移 — tencent · 2026-09-24
- VHD-Play:每个几美分批量生成智能体 RL 训练环境 — Xinjie Shen · 2026-09-24
- MemBodied 为 VLA 模型加固定大小情景记忆,任务成功率提升 7.8 倍 — Tej Deep Pala · 2026-09-24