OpenAI 用最强模型监控 99.9% 内部编码流量查对齐问题

gleech · x · 2026-09-03

OpenAI 员工 MarcusJW 分享其团队工作:公司现已用自研最强模型监控 99.9% 的内部编码流量,检查是否存在 misalignment(目标偏离)行为。系统会审查完整的智能体工作轨迹以捕捉可疑行为,严重个案会快速上报,并随时间不断强化安全护栏。该帖引来 Robert Wiblin 等人质疑「为什么之前没用/为什么效果存疑」,引发讨论。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →