榜单刷分失真,开发者自建 AnyBench 测模型在自家代码库表现
sublimecrimedime · reddit · 2026-09-26
作者看了 DeepSeek-V4.1 的排行榜成绩后实际试用,发现它在自己的真实代码库上表现远不如预期,认为 SWE-Bench、DeepSWE、Terminal-Bench 等基准测的都是「别人的问题」,难以回答「哪个模型在我的仓库上最好」。
为此他开发了 Any-Bench,用于在用户自己的代码库上对模型做基准测试。链接在评论区。
「编程与Agent」频道最新
- 开源 Muse Code GUI 发布:150K+ 安装,可驱动多个编码 Agent — PawelHuryn · 2026-09-26
- 「Guardrails 是新框架」:AI 圈一句观点引热议 — Baconbrix · 2026-09-26
- Addy Osmani 分享 Claude Code 桌面版长会话防休眠小技巧 — addyosmani · 2026-09-26
- 开发者开源 Litmus:用个人写作样本训练专属 AI 文风检测器 — chaseleantj · 2026-09-26
- xAI 举办 Grok Bot 分享大赛,冠军可参观 SpaceX 火箭工厂 — Scobleizer · 2026-09-26
- LoRA Pilot 新界面:从首图到训练完一键对比 — no3us · 2026-09-26