bury-bench:不用 LLM 评审、按 ADHD 友好规则给编码 Agent 回复打分

Obluness · reddit · 2026-09-11

作者开源了 bury-bench:一个确定性(零 LLM-judge)的评测框架,按「别把答案埋在废话里」的 ADHD 友好规则给编码 agent 的回复打分,并生成 Markdown 排行榜。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →