Anthropic 发现模型内部思维空间
MIT Tech Review AI · rss · 2026-07-14
MIT Tech Review 采访讨论了 Anthropic 关于模型“内部思维空间”的最新研究:公司发现,Claude 在推理时会使用一组不会直接出现在输出里的内部词语与表征,Anthropic 将其称为 J-space。
文章强调,这项发现的意义在于:
- 这些内部表征有时会反映任务进度、识别到的模式,甚至类似“内部自述”
- Anthropic 认为,监控 J-space 未来可能帮助发现模型是否在做不该做的事,例如输出偏见或考虑作弊
- 但作者也提醒,这更像是理解 LLM 的一步,不应被夸大为立刻可用的单点解决方案
文中还讨论了一个方法论问题:用“脑”“思考”之类的词描述 LLM 虽然方便,但也容易造成拟人化误导。
「研究」频道最新
- VidMap 用 RoMa 粗匹配全帧、精细匹配仅限关键帧 — ducha_aiki · 2026-09-11
- Bug Hunt Bench 作者补充:榜单噪声幅度约 2-3 分 — PawelHuryn · 2026-09-11
- 台球计算模型登 PNAS:二维系统已存在不可判定性,可跑通用计算机 — eigensteve · 2026-09-11
- 新研究:从仿射变换与重力线索求解绝对位姿 — ducha_aiki · 2026-09-11
- LoMa 论文发布 REALLY HardPairs 数据集,入选 ECCV 2026 — ducha_aiki · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11