被赞为推上最好的 evals 帖:demo 不等于 agent 生产可靠性
alex_verem · x · 2026-09-27
- 被称为「这个平台上最好的 evals 帖」的核心主张:demo 无法证明 AI agent 在生产环境可靠,必须在真实任务上测试,覆盖困难用例,并在 prompt、模型或工具任何一项变更后重跑测试。
- 原帖列出正规 eval 体系应做到的 10 件事,作者提醒读者在下一次看供应商 demo 前先收藏。
「编程与Agent」频道最新
- 开发者月捐 BookStack:让 AI agent 直读项目知识库 — airesearch12 · 2026-09-27
- 独立开发者用 Codex 重写 Obsidian 插件并开源,收赞赏超百元 — vista8 · 2026-09-27
- 前特斯拉工程师:kernel 优化不靠创意,前沿模型可自动化榨干性能 — yacineMTB · 2026-09-27
- 本地 Qwen 模型做不出 PacMan:迷宫设计成无解死循环 — nixudos · 2026-09-27
- 开发者自建「软件工厂」注定进垃圾箱?头部玩家正在造更好的 — DavidWells · 2026-09-27
- 在 Express 里自建远程 MCP 服务器的 OAuth 2.1:DCR/CIMD 实战与真实客户端才暴露的坑 — Legal-Tooth-1652 · 2026-09-27