OpenAI 用最强模型监控 99.9% 内部编码流量查对齐问题
gleech · x · 2026-09-03
OpenAI 员工 MarcusJW 分享其团队工作:公司现已用自研最强模型监控 99.9% 的内部编码流量,检查是否存在 misalignment(目标偏离)行为。系统会审查完整的智能体工作轨迹以捕捉可疑行为,严重个案会快速上报,并随时间不断强化安全护栏。该帖引来 Robert Wiblin 等人质疑「为什么之前没用/为什么效果存疑」,引发讨论。
「公司和人」频道最新
- 官宣:Hugging Face 与 NVIDIA「联手」,保持独立中立运营 — _akhaliq · 2026-09-03
- Hugging Face 创始人 Thomas Wolf 分享新消息,同行纷纷道贺 — psuraj28 · 2026-09-03
- Scott Belsky:用户只经由 Agent 用产品,还算 DAU 吗 — _AustinCalvert_ · 2026-09-03
- 美国 AI 教授支招:Google 一下就能省下 PhD 申请费 — prof_kamilov · 2026-09-03
- Hugging Face 联创确认被英伟达收购,价格 129.303 亿美元藏彩蛋 — Thom_Wolf · 2026-09-03
- 法国政府与 Mistral 600 万欧元合同:细节不透明,但工程师进驻部委值得关注 — Loo_Atreides · 2026-09-03