Sentry 创始人分享 LLM eval 经验:断言尽量确定性
Sentry 联合创始人兼 CTO David Cramer 在讨论 AI 编码工作流时分享 LLM eval 的成本与实践经验:他的测试断言大多采用确定性检查,rubric 用得极少且写得非常精简,只在少数非确定性场景使用 LLM 判官,因为后者成本高昂——他透露两周前跑一次 metaloop 一小时就烧掉 200 美元,而有开发者 4 个很小的 eval 一轮开销也不菲。
2026-09-10 ~ 2026-09-10 · 3 条相关
- Sentry 创始人吐槽 eval 成本:跑一次 metaloop 一小时烧 200 美元 — zeeg · 2026-09-10
- Sentry 创始人谈 eval 成本:断言尽量确定性,LLM 判官太贵 — zeeg · 2026-09-10
- Sentry 工程负责人分享 CI 中用 LLM 断言的经验:多数断言保持确定性 — zeeg · 2026-09-10