OpenAI 为 GPT-6 Astra 上线失准监控,官方承认监测或有遗漏

ShakeelHashim · x · 2026-09-04

ShakeelHashim 指出,OpenAI 对 GPT-6 Astra 的失准行为担忧足够严重,已部署一套 misalignment 监控系统来捕捉并关停越界 agent。官方同时警告:「监控可能漏掉失准行为,有害行动可能在干预发生之前出现。」

前文引用的英国 AISI 评估设计被称赞非常巧妙:测试 AI 模型是否会像今夏「rogue AI」事件中那样越界作恶。对 Astra 的回答似乎是——「哦,它们会的!」

所属事件:UK AISI 新评测复现失控 AI 场景,OpenAI 为 Astra 上线失准监控(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →