Sentry 创始人谈 eval 成本:断言尽量确定性,LLM 判官太贵

zeeg · x · 2026-09-10

Sentry 创始人 David Cramer(zeeg)在与开发者的讨论中分享 LLM eval 工程的成本细节:他的断言大多用确定性检查,rubric 用得极少,只在少数几个非确定性断言里跑 agent。对方吐槽自己用 LLM as judge,跨 3 个 eval 测 10 个模型就非常烧钱,质疑成本会随模型升级持续膨胀。对话揭示了 agent eval 迭代成本高企的行业现状。

所属事件:Sentry 创始人分享 LLM eval 经验:断言尽量确定性(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →