Goodfire 推出模型内部监视器,以极低成本揪出失控 AI Agent

emmanuelvivier · x · 2026-10-11

传统监控 AI Agent 的方式是让另一个模型盯着它的输出,但当 Agent 运行数小时、处理大量文本时成本极高。可解释性创业公司 Goodfire 推出新的「由内而外」监视器:直接观察模型内部运行状态,捕捉风险行为的信号,而非只读输出。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →