GPT-6 Astra 被指泄露 neuralese 内部思考痕迹

用户 Ivan Bezdomny 等人观察到 Google 对话模型 Astra 似乎在输出中毫无遮掩地泄露内部「神经密语」(neuralese)思维痕迹,并贴出其内部备注样例,内容包含「收到新数据包,仅9组。不要停止……」等指令式片段。该现象被指没有隐藏意图,引发对模型内部思考外泄的关注。

2026-09-06 ~ 2026-09-06 · 2 条相关