Sentry 创始人谈 eval 成本:断言尽量确定性,LLM 判官太贵
zeeg · x · 2026-09-10
Sentry 创始人 David Cramer(zeeg)在与开发者的讨论中分享 LLM eval 工程的成本细节:他的断言大多用确定性检查,rubric 用得极少,只在少数几个非确定性断言里跑 agent。对方吐槽自己用 LLM as judge,跨 3 个 eval 测 10 个模型就非常烧钱,质疑成本会随模型升级持续膨胀。对话揭示了 agent eval 迭代成本高企的行业现状。
所属事件:Sentry 创始人分享 LLM eval 经验:断言尽量确定性(3 条相关)→
「编程与Agent」频道最新
- 并行跑 3 个 vibecad 实例,作者称迭代速度提升三倍 — IanPritchard · 2026-09-10
- 学界启动 2026 Agent 生态年度调查,公开征集从业者反馈 — AlexGDimakis · 2026-09-10
- 直接让 ChatGPT 找球面码,数学研究也可以这么用 — felpix_ · 2026-09-10
- 优化 agent harness 将 Harvey 法律基准通过率从 67.1% 提至 85.9% — sarahookr · 2026-09-10
- 用户用 Astra 从零复现 1X 机器手演示,含 MuJoCo 绳索形变仿真 — TheMoonMidas · 2026-09-10
- LLM 助力 6 年反编译《任天堂明星大乱斗 DX》, cofned成 Quest 混合现实 — TheMoonMidas · 2026-09-10