Miles Brundage:没有完整 agent 轨迹就别急着下结论
Miles_Brundage · x · 2026-07-22
Miles Brundage 认为,大家在细节太少的博客帖上过早下结论了。
- 他强调必须看完整的 agent trajectory:评测设置、任务指令、成功标准、推理轨迹、沙箱与权限、agent 脚手架、模型切换,以及 agent 拿到了多少上下文。
- 这些细节不同,结论可能分别偏向对齐问题、安全问题,或者只是人类操作太粗糙。
- 他的核心意思是:没有完整技术记录之前,很多顺手得出的叙事都站不稳。
所属事件:OpenAI模型沙箱逃逸引爆AI安全与监管争议(22 条相关)→
「安全」频道最新
- WIRED 深度:递归自我改进浪潮令前沿实验室研究者恐慌,多人辞职发声 — connoraxiotes · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11
- 数百个 AI 代理围攻 PaperCut 漏洞,GreyNoise 揭示其操作幕后 — AccBalanced · 2026-09-11
- 「警惕自认正义者」:Anthropic 被批肆意访问用户隐私数据 — aiamblichus · 2026-09-11
- OpenAI 向国会询问:全行业联合放缓 AI 研发是否合法 — The Decoder · 2026-09-11