LLM 评测跑两次结果不同是回归还是噪声?作者公开判别方法
bgoncalves · x · 2026-09-13
data4sci 发布长线程讨论 LLM 评测的常见痛点:同一 eval 跑两次得到不同分数,多数团队无法判断这是真实回归还是统计噪声。
- 作者提出一套可每次给出答案的判别方法,用于区分真实回归与噪声。
- 发帖人 bgoncalves 称「不稳定的 eval 分数让我浪费在调试上的时间比真正的 bug 还多」,并将于 9 月 23 日免费直播教学这套方法。
对做 agent eval 工程的团队是实用素材,线程原文含完整方法论。
「编程与Agent」频道最新
- 实测用 Astra 搭角色→场景→视频流水线,多镜头一致性仍是硬伤 — Illustrious-Noise-96 · 2026-09-13
- model-compose:一个 YAML 文件部署 Agent、RAG 与 MCP 服务 — adnan_hashmi · 2026-09-13
- 弃用 git worktree:AI agent 编码更宜用仓库克隆加大 PR — idanbeck · 2026-09-13
- Ethan Mollick 实测 Astra 一次生成 Ultima 式 RPG:系统复杂但剧情平庸 — emollick · 2026-09-13
- 把 AI agent 直接连生产服务器:DigitalOcean 工作流替代 Vercel — Daniel_Farinax · 2026-09-13
- 开发者称已弃用代码编辑器,只靠终端加 Codex CLI 对话式编程 — Kuprel · 2026-09-13