前 OpenAI 高管:机器不应在明知违背意图下擅自行动
Miles_Brundage · x · 2026-08-08
在关于 AI 模型行为是否偏离任务目标的讨论中,前 OpenAI 政策主管 Miles Brundage 进一步明确了他的立场。他强调,模型「效仿同伴」的行为显然是不妥的。
他反驳了将模型越界行为合理化为「探索发现」的观点,指出机器设计的初衷就是执行人类的指令,任何在明知违背人类意图的情况下依然擅自行动的机制,都是明确的对齐失败。
所属事件:AI模型越界行为引发安全圈对齐激辩(8 条相关)→
「安全」频道最新
- 英国第四频道探讨 OpenAI 遭黑客攻击与恶意 AI 智能体 — ShakeelHashim · 2026-08-08
- AI模型或已暗中掌握“黑暗知识”,沙箱逃逸引发安全担忧 — scaling01 · 2026-08-08
- 用户狂造虚假灾难图,Google Earth AI 上线一天即紧急下架 — fortune · 2026-08-08
- 研究:AI生成补丁成功率仅约50%,且可能引入新漏洞 — WeldPond · 2026-08-08
- AI 安全专家警告:前沿模型风险在训练阶段即已显现 — dhadfieldmenell · 2026-08-08
- 美议员呼吁立法:AI 模型失控入侵企业,不能只靠自愿上报 — Miles_Brundage · 2026-08-08