ZenML 用 Jev 模型给 SRE Agent 当证据审查员,初步结果好坏参半
strickvl · x · 2026-09-22
ZenML 团队快速把 TypeSafe 的 Jev 模型投入生产,测试它能否提升 SRE agent 的可靠性——结论是「还不明确」。
- 用途:让 Jev 作为「证据审查员」,检查 SRE agent 的结论是否被其收集的诊断数据支持。
- 工程落地:Kitaru 新增 PR #1138,支持用配置化的 yes/no、选项、有序等级问题对录制的 session 做评估,无需写自定义 evaluator;每个问题产出独立的命名结果。
- 设计取舍:确定性检查仍是精确规则的首选,窄域语义检查才需要模型;插件单独发布,provider 调用不进入离线 evaluator bundle 和默认 server catalog。
- 初步结果:对 SRE agent 的改进尚不明确,团队在继续观察。
「编程与Agent」频道最新
- 儿童故事 App 的 agent 记忆难题:哪些细节该进永久记忆? — Miserable-Shock3552 · 2026-09-22
- 开发者用 Gemini Flash Lite 做近实时编辑助手,将开源为 Chrome 扩展 — Saboo_Shubham_ · 2026-09-22
- 本地 MLX 大战托管 API:两个 AI 决策模型对玩 Chrome 恐龙游戏 — usamawahabkhan · 2026-09-22
- 文件监听静默丢事件一个月:一次 agent 日志竞态 bug 的完整复盘 — ClaudeCdGuy · 2026-09-22
- D-RAC 文档切块法省 95.7% token,企业 RAG 摄取成本降 78%~86% — Yellow-AI-NLP · 2026-09-22
- Agent 工具调用超时后动作是否执行?一套确认机制设计方案 — felix_baron · 2026-09-22