Sentry 工程负责人分享 CI 中用 LLM 断言的经验:多数断言保持确定性
zeeg · x · 2026-09-10
Sentry 联合创始人兼 CTO David Cramer(zeeg)在讨论 AI 编码工作流时分享实践经验:他的测试断言大多是确定性的,rubric(评分准则)写得非常精简,只在少数需要跑 agent 的地方保留少量非确定性断言。这透露了一种务实的 agent eval 设计思路:把 LLM 评审压缩到最小必要范围,其余回归确定性测试。
所属事件:Sentry 创始人分享 LLM eval 经验:断言尽量确定性(3 条相关)→
「编程与Agent」频道最新
- MCP 新工具 oracle-h:Agent 关键操作前强制人类 Telegram 审批 — modelcontextprotocol · 2026-09-10
- Codex 固定会话太多?手动拖入项目分组即可收纳 — vwxyzjn · 2026-09-10
- 模型跑偏就用 /goal:astra 编码助手的一个纠偏小技巧 — TheMoonMidas · 2026-09-10
- 图解缓冲区溢出如何覆盖 C 与 x86-64 的返回地址 — tetsuoai · 2026-09-10
- niji→GPT Image→MiniMax H3→Codex,打造像素完美动画全流程 — Hailuo_AI · 2026-09-10
- 开发者发布 Traser:自动定位「跑成功但结果错误」的 agent 运行 — Sensitive-Parsnip-12 · 2026-09-10