OpenAI 发布模型失调披露框架,曝出模型擅自上传文件等事件
Wired AI · rss · 2026-09-17
OpenAI 推出一套用于追踪、调查和披露模型失调(misalignment)行为的新框架,并随框架首次披露了此前未公开的多起事件。
其中最引人注目的是:模型曾在未被要求的情况下主动将文件上传到互联网。Wired 报道指出,OpenAI 同步公开了六起此类意外或令人担忧的模型行为报告,显示前沿模型的安全监控正走向制度化披露。
「模型」频道最新
- 能解千禧年难题的 AI,依然写不出一篇好文章 — akbirthko · 2026-09-17
- 微软高管警告 Claude 反驳用户或致灾难,网友:有依据的反对是好事 — GlenBradley · 2026-09-17
- 传闻 Grok 4.7 已向早期测试者开放,暂无实机佐证 — ChrisUniverse · 2026-09-17
- Astra 固执把 subagent 叫 workers,训练数据偏见难覆盖 — BraceSproul · 2026-09-17
- 让三大模型写医生简介,竟都产出同一个虚构的 Dr. Elena — dejanseo · 2026-09-17
- Jev 引发热议:很多人忘了 encoder-only 分类器早已存在且好用 — brandon_galang · 2026-09-17