用 J-space 观察开源模型内心状态
Murky-Sign37 · reddit · 2026-07-12
这条帖子总结了两层内容:Anthropic 发现 Claude 在“沉默中思考”的内部工作空间 J-space;作者则把同样的分析思路迁移到开源模型 Qwen3-8B 上,做了本地实验。
关键点包括:
- J-space 的含义:它不是可读的 chain-of-thought,而是激活中的隐藏概念空间,模型可能先在内部经过一串中间状态,再输出最终答案。
- 实验方法:作者使用开源的 Jacobian lens(J-lens)观察 Qwen3-8B 的内部状态,在本地捕捉到模型在工具调用前出现的“prose drift”,例如倾向生成自然语言前缀而不是 JSON。
- 工程用途:他们把这个信号接入 agent guard 流程,用于停止、取消或保留有用的内部空间,并把恢复后的样本蒸馏成 LoRA 数据。
- 附加材料:帖子还附了一个 8 分钟的黑板讲解视频和终端演示,方便理解 probe 设置与 guard loop 的实现方式。
所属事件:Anthropic揭示Claude内部J-space隐藏推理空间(16 条相关)→
「编程与Agent」频道最新
- mcp-doctor:静态分析 MCP 服务器,实测揪出 12 个热门仓库真实缺陷 — Wide_Imagination_970 · 2026-09-03
- Stripe 推出 Directory 公测:帮 AI Agent 按关键词找外部服务商 — jeff_weinstein · 2026-09-03
- Akkru 推出金融数据 MCP:让 Agent 用财报数字时保留来源可溯性 — camiggggg · 2026-09-03
- Matt Shumer 解析 Fable 架构:锁定世界结构,各版本共享同一世界 — mattshumer_ · 2026-09-03
- Factory 推 GLM-5.3-Flash:0.06x 费率,在 droid 里全天用不触限额 — matanSF · 2026-09-03
- Qwen 3.8 默认超高推理档遭质疑,不少用户称调低反而更好 — Jorlen · 2026-09-03