别只信基准测试:如何在真实工作环境中评测 LLM?

WhatererBlah555 · reddit · 2026-08-25

作者指出,主流基准测试虽然有用,但模型可能为此过度优化;而凭直觉判断又不可靠,简单的测试任务也无法代表实际工作负载。因此向社区请教:大家在工作环境中是如何对 LLM 进行基准测试的?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →