10 种格式实测:图序列化改法让多跳准确率翻倍
Immediate-Cake6519 · reddit · 2026-07-27
一位开发者分享了一项发现:图数据的序列化格式本身,就能显著影响本地模型在图推理任务上的表现。
关键结果
- 比较了 10 种图序列化格式,包括 JSON、GraphML、RDF 变体、edge list 等
- 冗长格式里,约 70% 的 token 都浪费在括号、引号和重复 key 这类语法上
- 在 8K 本地模型里,这会把可用的图上下文预算压缩到原来的大约三分之一
- 仅仅改格式,多跳准确率 就从约 40% 提升到 80%
- 训练中常见的表格/关系式布局,普遍优于嵌套式标记
他们做了什么
- 做了一个叫 ISONGraph 的轻量级 property graph 格式,专门优化 LLM 可读性
- 据称可带来约 70% 更少的 token 和 92% traversal accuracy
- 支持完全离线、可配合本地模型使用
- 以 MIT 许可证提供 Python、JS/TS、Rust、Go、C++、C实现
「研究」频道最新
- 卡内基梅隆 AI Science Foundry 获 NSF 2000 万美元资助 — jmuiuc · 2026-07-27
- 77.5 万科学家研究:LLM 推动科研跨向更远领域 — i_dg23 · 2026-07-27
- IGGT4D 用流式 Transformer 实时理解 4D 场景 — liuziwei7 · 2026-07-27
- 102 万个 PR 研究:Agent 代码评审更快,却未提升质量 — rohanpaul_ai · 2026-07-27
- Anthropic Opus 5 在 ARC-AGI-3 达 30%,但盲测没拉开差距 — NathanpmYoung · 2026-07-27
- Paul David 用 106 页论文追溯开放科学的起源 — michael_nielsen · 2026-07-27