改 chunk 长度会改基准,不只是改一个 perplexity 数字
gordic_aleksa · x · 2026-07-27
这条帖在分析 document-aware evaluation 的偏差来源:当 chunk length 改变时,真正变化的主要是边界文档占比,而不是整个评估逻辑。
作者指出,真正会被截断“伤到”的通常只有每个 chunk 开头那篇部分文档。若总 token 数为 N、chunk 长度为 L、窗口长度为 W,那么边界文档数量约为 N/L,而受影响 token 总量大致按 W·N/L 量级增长。结论是:不同 chunk size 下得到的 ppl 应该视为不同 benchmark,不能直接横向比较。
「研究」频道最新
- 研究称 AI 编码提效,可能更取决于项目规模而非模型 — MelodicStep6956 · 2026-07-27
- 研究称 AI 编码提效,可能更取决于项目规模而非模型 — MelodicStep6956 · 2026-07-27
- 法律文档 Agent 用 Google ADK、MCP 和四种解析器降幻觉 — MaryamMiradi · 2026-07-27
- FreeStyle 挖社区 LoRA,提升风格内容双参考生成 — jiqizhixin · 2026-07-27
- ACL 2026 论文提出两项指标,判断 VLM 解释是否可信 — BrihiJ · 2026-07-27
- 美光与 Meta 白皮书称 Spark 溢写 SSD 后可慢 38 倍 — dr_alphalyrae · 2026-07-27