榜单刷分失真,开发者自建 AnyBench 测模型在自家代码库表现

sublimecrimedime · reddit · 2026-09-26

作者看了 DeepSeek-V4.1 的排行榜成绩后实际试用,发现它在自己的真实代码库上表现远不如预期,认为 SWE-Bench、DeepSWE、Terminal-Bench 等基准测的都是「别人的问题」,难以回答「哪个模型在我的仓库上最好」。

为此他开发了 Any-Bench,用于在用户自己的代码库上对模型做基准测试。链接在评论区。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →