LangChain 开源 WikiBench:量化代码库 Wiki 对编码 agent 的增益
LangChain · x · 2026-08-26
LangChain 团队为评估其开源代码库文档 agent OpenWiki 构建了 WikiBench 基准,回答两个问题:
- 某个 wiki 本身质量如何——用基于底层代码库生成的有据可依的问题来评估不同 wiki 的质量差异;
- wiki 到底有没有帮助——同一批问题以三种方式运行:仅用 wiki、仅用源码、两者都用,比较哪种胜出。
WikiBench 基于 Harbor 框架构建,用于评估长时运行任务上的智能体,Harbor 任务包含三个组成部分。目的是在持续改进 OpenWiki 的过程中能量化「改动是否真的让 wiki 更好、对编码 agent 更有用」。
所属事件:LangChain 开源 WikiBench 评估代码库文档 Agent 效果(4 条相关)→
「编程与Agent」频道最新
- Devin 重构渲染器以支持超长会话 — premqnair · 2026-08-27
- Karpathy 斯坦福一小时讲座:AI 工程的进阶路径 — AlishaOutridge · 2026-08-27
- SpaceXAI 工程师分享构建 24/7 Agent 团队实战 — soleio · 2026-08-27
- 利用 AI 审计论文:识别 97.7% 的真实问题 — littmath · 2026-08-27
- Grok 语音模型集成 LiveKit,端到端实现患者分诊 Agent — SpaceXAI · 2026-08-27
- Rippling 拆解四层 eval 流水线:数十条关键场景即可封锁上线 — LangChain · 2026-08-27