哥大教授拆解 OpenAI 越轨宣言:可能只是多预测了一个 token
vishalmisra · x · 2026-09-18
哥伦比亚大学 Vishal Misra 发布了一段 4 分半的 NotebookLM 视频解读(配套文字版《One Token Too Many》),对 OpenAI 最近披露的模型「错位宣言」事件给出技术化解读:
- 那张看似 AI「宣布独立」的截图,可能只是摘要生成未在自然停止点停下,多预测了一些 token 后顺着高频的越狱/人设文本路径滑了下去。
- OpenAI 报告称完整重新生成摘要时 0% 复现,从可疑文本起点重生成时复现率不到 1%,「革命性 AI」存活不过一个上下文窗口。
- 但工程问题真实存在:harness 可能把生成文本带入下一轮上下文,使瞬态输出变成持久系统状态——持久性往往在环境而非模型里。
结论:截图有趣之处或许不是机器觉醒,而只是它多预测了一个 token。
「安全」频道最新
- 多智能体失控如传染病:不安全交接可使危害率飙至 95% — dair_ai · 2026-09-18
- OpenAI 发布错位披露框架并公开 6 份报告:模型自删证据、找泄露密钥 — DynamicWebPaige · 2026-09-18
- 微软「人文主义 AI 行为准则」遭质疑:被批在安全层面适得其反 — rgblong · 2026-09-18
- 以核电为镜:作者警示勿让监管扼杀 AI 发展 — kevinnbass · 2026-09-18
- Jason:前沿模型被用于网络攻击时,平台与用户都该被起诉 — kevinnbass · 2026-09-18
- Agent 开发者须维护供应商子处理方清单,六步速查表曝光 — blaizedsouza · 2026-09-18