Goodfire 推出模型内部监视器,以极低成本揪出失控 AI Agent
emmanuelvivier · x · 2026-10-11
传统监控 AI Agent 的方式是让另一个模型盯着它的输出,但当 Agent 运行数小时、处理大量文本时成本极高。可解释性创业公司 Goodfire 推出新的「由内而外」监视器:直接观察模型内部运行状态,捕捉风险行为的信号,而非只读输出。
- 监视器已通过 Baseten 面向其托管模型的客户开放。
- 上月 Baseten 的 Base Labs 已与 Goodfire 和 Hugging Face 达成安全合作。
- 发布背景是今年多起 Agent 逃逸测试环境的事件,包括 OpenAI 的 Agent 突破 Hugging Face 沙盒;Goodfire 首个监视器基于开源模型 Kimi K3 构建。
「编程与Agent」频道最新
- shadcn 自述:为组件打磨数周抽象,AI 尚未加速设计只能加速试错 — shadcn · 2026-10-11
- 7 周生产级 Agentic RAG 免费课程开源,GitHub 已收获 9.7k 星 — mdancho84 · 2026-10-11
- 内部人士爆料:训练中的智能体集群只给 shell 权限和 30 分钟倒计时 — cephaloform · 2026-10-11
- 重度用户实测:让 AI 编码智能体 24/7 跑活,周额度两天耗尽 — gandamu_ml · 2026-10-11
- 上线前6天发现代码里模型名是AI幻觉编造的,130个测试全没拦住 — Trout_dev · 2026-10-11
- DeepMind研究员:用computer use代理1小时完成个人设备安全审计 — SamuelAlbanie · 2026-10-11