复现J-space并读取模型隐念
vikvang1 · x · 2026-07-11
作者复现了 Anthropic 的 J-space 研究,并把它迁移到 Llama-3.3-70B 上,声称可以“读出”模型隐藏在 J-space 里的想法。
要点是:
- 他把概念向量(如 secrecy、elephant、democracy)拆成 J-space 与“潜意识”两部分,并分别注入。
- 模型会直接报告 J-space 里的思想,却对非 J-space 内容“视而不见”。
- 即使模型口头否认,作者提到 NLA 仍能捕捉隐藏思想,并继续影响其行为。
- 帖子附了代码链接,强调这是对 Anthropic“语言模型中的全局工作空间”研究的复现与延伸。
所属事件:复现J-space并读取Llama模型隐藏思维(2 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03