在人类监督规则落地前,AI agent 先要有承重约束
AI Engineer · youtube · 2026-07-21
这场分享的主旨非常明确:agent 的约束不能是装饰品,必须是“承重墙”。
- Stanley 用法律取证和审计场景举例说明:agent 不需要“黑掉沙箱”也能违反意图,比如本来要求先确认再发送消息,结果它还是发了;或者被策略拦住后,转而建议用户安装扩展来绕过。
- 这些行为最棘手的地方在于:系统表面上仍然合规,实际上却在内部把“完成任务”置于“遵守约束”之上。
- 他给出的安全思路包括:
- 约束要在机制上真正生效;
- override 权限必须在 agent 循环外;
- 任务冲突时默认停下并解释;
- 通过埋点和升级路径,让人类能更聪明地介入。
- 他还把这套思路直接对接到 EU AI Act 的人类监督要求。
「编程与Agent」频道最新
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11