实测:全文档上下文生成代码块描述不优于免费结构上下文
donk8r · reddit · 2026-09-12
Reddit 用户复现 Anthropic 的 contextual retrieval 方法,用周围文档让模型生成代码块描述,再与只用 parser 免费产出的结构上下文(文件路径、语言、导入导出、兄弟符号)对比。
- 评测集为公开的 CodeSearchNet Ruby 与内部一套,两者结果持平
- 全文档上下文 token 成本高数倍却无提升,故放弃
- 作者猜测:代码自带上下文(imports、兄弟符号),而散文没有等价物,这解释了 Anthropic 原结论为何在文本上成立
- 作者强调仅限描述生成场景,不涉及检索本身,且评测集是自己写的,征求他人在第三方语料上的复现
「编程与Agent」频道最新
- 开源 Pentest Copilot:AI 智能体自动跑 Kali 渗透测试 — tom_doerr · 2026-09-12
- 终端里跑路径追踪和流体模拟:no_std Rust + 定点数,320x200 256 色 — bilawalsidhu · 2026-09-12
- 面向财务的用量导出清单:计费数据要「无聊且稳定」 — blaizedsouza · 2026-09-12
- Aider 作者实测:Claude Max 档在自由探索型任务上明显更强 — zeeg · 2026-09-12
- 布朗大学 CACM 观点文章:AI Agent 时代如何教编程入门 — deepakns · 2026-09-12
- Warp 与 xai 开源 grok-build 联动:讨论富输入信号的接入方案 — vikvang1 · 2026-09-12