开发者的硬观点:不能阻止合并的 eval,只是装饰品
bgoncalves · x · 2026-10-01
在「LLM 应用没有 CI 评测门禁、你其实不知道它还能不能跑」的热议下,开发者 bgoncalves 亮明立场:如果你的 eval 不能阻止一次 merge,那它就只是装饰。
核心论点是 LLM 应用的质量保障必须落到 CI 流水线里——评测结果要能作为合并的硬性门槛,而不是靠人工抽查来确认「上次是好的」。
「编程与Agent」频道最新
- Runable 推出冷启动外联 Agent:自动找线索打电话发邮件全年无休 — SimplyAnnisa · 2026-10-01
- Git 核心开发者炮轰 Git 3 默认 SHA256:安全表演且多年不可用 — vmg · 2026-10-01
- 开发者实测数月:AI agent 已能驾驭复杂重构与架构演化 — dreamwieber · 2026-10-01
- 资深程序员:说 AI 建不出可维护架构是很 2023 的看法 — dreamwieber · 2026-10-01
- 经济学家:AI 改过的代码会失控,我的解法是设'AI 专属文件夹' — paulnovosad · 2026-10-01
- 本地模型跑 computer use 慢但能用,受监管行业怎么选? — Ambitious_Fold_2874 · 2026-10-01