Sentry 创始人分享 LLM eval 经验:断言尽量确定性

Sentry 联合创始人兼 CTO David Cramer 在讨论 AI 编码工作流时分享 LLM eval 的成本与实践经验:他的测试断言大多采用确定性检查,rubric 用得极少且写得非常精简,只在少数非确定性场景使用 LLM 判官,因为后者成本高昂——他透露两周前跑一次 metaloop 一小时就烧掉 200 美元,而有开发者 4 个很小的 eval 一轮开销也不菲。

2026-09-10 ~ 2026-09-10 · 3 条相关