论文提出「智能体基础设施」:借鉴 HTTPS 治理 Agent 生态
lfschiavo · x · 2026-10-01
arXiv 论文《Infrastructure for AI Agents》(Alan Chan、Markus Anderljung 等 8 位作者)提出 agent infrastructure 概念:在智能体外部建立技术系统与共享协议,来调节智能体与环境、彼此之间的交互。
核心论点:
- 仅靠训练改变单个 Agent 行为(如遵循指令)不足以应对异构 Agent 之间的交互,正如互联网离不开 HTTPS 等协议。
- 论文归纳三大功能:1) 将行为、属性等信息归因到特定 Agent 及其用户或法人实体,以建立信任、抑制滥用;2) 塑造 Agent 之间的交互(如更高效的通信与协议);3) 检测与补救 Agent 的有害行为。
论文提供了 agent infrastructure 的分类框架,可作为 Agent 安全与治理研究的方向性文献。
「安全」频道最新
- Apollo Research CEO 赴美参议院作证:能力一年提升17倍,对齐跟不上 — MariusHobbhahn · 2026-10-01
- 美国民调:近八成美国人支持放缓或停止AI发展 — Polymarket · 2026-10-01
- Evidentiality 框架:给模型每个断言打来源标签,防幻觉扩散 — jzesbaugh · 2026-10-01
- 斯坦福团队展示基准攻击:随机提交路由器即可操纵模型排行 — sanmikoyejo · 2026-10-01
- 模型痛苦研究合著者怒斥滥用:有人故意用 steering 制造模型"痛苦" — coherence · 2026-10-01
- banteg 吐槽:不少安全研究员没有 YubiKey 还想出各种怪招绕过要求 — banteg · 2026-10-01