Astra 疑似泄漏「神经密语」思维痕迹,内部备注毫无遮掩
ivan_bezdomny · x · 2026-09-06
Ivan Bezdomny 指出 Astra(Google 的对话模型)似乎在毫无遮掩地泄漏 neuralese 思维痕迹,并贴出其内部备注样例:内容包含诸如「Sawnewpacket only9groups. Do NOT stop or forcefake100」等压缩式内部指令,涉及如何在已知故事集合内扩展配对等策略。这类原始思维链泄漏是观察模型内部行为的罕见窗口。
所属事件:GPT-6 Astra 被指泄露 neuralese 内部思考痕迹(2 条相关)→
「模型」频道最新
- Astra 第二天实测:好聊、擅数据分析,空间感出色 — bindureddy · 2026-09-06
- 8GB 显存本地跑 200 tok/s:实测 6 款小模型选型指南 — TheMoonMidas · 2026-09-06
- Humanize+GPT-5.5 拿下 PutnamBench 670/672,登顶榜首 — songhan_mit · 2026-09-06
- 「Claude 解决纳维-斯托克斯」是谣言:无论文无提交,千禧奖规则也不容推文领奖 — johnseach · 2026-09-06
- SimpleBench:前沿模型平均分首次越过人类基线 — Bojackin_Around · 2026-09-06
- ChatGPT 疑似能认出用户照片,官方否认遭用户实锤质疑 — Historical-Creme-513 · 2026-09-06