bury-bench:不用 LLM 评审、按 ADHD 友好规则给编码 Agent 回复打分
Obluness · reddit · 2026-09-11
作者开源了 bury-bench:一个确定性(零 LLM-judge)的评测框架,按「别把答案埋在废话里」的 ADHD 友好规则给编码 agent 的回复打分,并生成 Markdown 排行榜。
- 痛点:actionable 的关键答案总被「Great question!」、对冲措辞和「Hope this helps!」淹没;灵感来自走红的 i-have-adhd skill
- 用 regex、结构与启发式检查实现可复现评分:同样输入 → 同样分数,无需模型互评
- 示例:好的回复约 76.9 分,被淹没的回复约 7.9 分
- 开箱即用(无需 API key):bury-bench ingest samples/chat.l 对比 samples/chat-buried.l,欢迎社区对代理指标(对冲密度、多轮重述)提出批评
「编程与Agent」频道最新
- 社区发起 Qwen 3.8 Flash 本地推理加速赛,MLX 对决 CUDA — gajesh · 2026-09-11
- 数据索引服务 Tako 接入 Vercel AI Gateway — williamLberman · 2026-09-11
- 移动端读论文工作流:agent 边跑实验边陪你散步 — yaroslavvb · 2026-09-11
- 别再把报错粘贴给 AI 瞎猜:用 MCP 做更准的 Spark 调试 — rseroter · 2026-09-11
- alphaxiv 呼吁研究者弃用 Claude Code/Codex 转向开源模型:全栈自主权之争 — AdaptiveAgents · 2026-09-11
- Freebots 机器人竞技场为 KekiusBot 开启递归自我改进 — Daniel_Farinax · 2026-09-11