CodeGraph:用代码 LLM 为 1.67 亿源码文件构建开放分类知识图谱
Federico Pennino · hf · 2026-09-28
Federico Pennino 团队在 Hugging Face 发布 CodeGraph,一个针对源码的大规模开放分类知识图谱。
- 动机:GitHub 等公共仓库存有数十亿文件,但现有工具只能做语法/token 级分析,难以提取其中的工程知识(算法、范式、设计模式、应用领域)。
- 方法:用代码专用 LLM 做语义标注,再通过三阶段链接流程将实体锚定到 Wikidata:确定性 SPARQL 处理无歧义实体,Deep Research Agent 解决长尾,层级上卷导入父类闭包。
- 规模:应用于 Stack-Edu 语料的 1.67 亿个文件,得到约 1.58 亿节点、10 亿条类型化边的图谱,含约 6.3 万个概念实体和约 1.98 万个已锚定的 Wikidata 实体,覆盖 14 种编程语言。
- 质控:结合小规模人工金标集与 LLM-as-a-judge 过滤的校准质量评估协议,量化标注精度。
「研究」频道最新
- Schmidhuber 2008 年论文:好奇心即压缩进度算法 — anselm · 2026-09-28
- LLM 是随机鹦鹉吗?博主重提形式与意义经典论文 — lambdaviking · 2026-09-28
- 学生团队复盘安全事件响应 agent Aegis:记忆是设计决策而非开关 — pranitha95 · 2026-09-28
- 测试 AI 材料推荐时,故意合成一个预测表现差的材料 — bravo_abad · 2026-09-28
- Tau Robotics Delta-0:人形机器人开始自己生成训练经验数据 — CyberRobooo · 2026-09-28
- gnomAD MCP 服务器发布:统一查询三大版本基因变异数据库 — modelcontextprotocol · 2026-09-28