Moda 周报:用 Jev 捕捉更细信号,读完整对话找长跑 Agent 失误
KlausCodes · x · 2026-09-23
Agent 观测初创 Moda 开启每周工程更新,首期亮点:
- Jev 分类器升级:此前靠自研分类器筛查 tool failure、用户挫败等信号,客户定制信号因数据不足难以区分;引入 Jev 后内部基准上置信度和准确率显著提升,可追踪更细粒度的定制信号。
- 整段对话分析:对超长运行的 agent,单次扫描 trace 会漏掉跨上下文的问题(如第 1 轮被告知"改账单前先问",第 72 轮未经批准改了账单)。Moda 改为通读完整对话来捕捉这类问题。
- 产品更新:重构了 dashboard 与 trace 视图便于调查问题;Slack agent 公测,可直接在 Slack 里就告警提问;支持导入 Braintrust 历史数据,从过往 trace 中挖掘信号。
「编程与Agent」频道最新
- 把 Opus 5.5 拉满写 wildcard,它跑了 2 万次迭代只为不写错 a/an — mwoody450 · 2026-09-23
- 独行者用 MiniMax+Tripo+Blender 做出战斗短片,公开完整流程求指点 — Spoonman915 · 2026-09-23
- 微软 Agensh 论文:无中心编排扩到 1024 个智能体,通过率提升至 55% — andrew_n_carr · 2026-09-23
- 网传 GPT-6 可在浏览器操控 Paint 作画,演示引热议 — alexcovo_eth · 2026-09-23
- 双 Agent 并行开发实测:git 干净合并后测试全挂 — RunAI_Coder · 2026-09-23
- 手机拍照文本进电脑:OCR、视觉模型与 Agentic 流水线选择讨论 — silenceimpaired · 2026-09-23