新基准Session-Bench:评估10种编码harness的会话保留能力,Pi得分18/19

jazzy8alex · reddit · 2026-08-15

Session-Bench 是一个新的 agentic benchmark,评估编码 harness 在任务完成后保留会话记录的能力。它比较了 10 种 CLI 会话格式,涵盖完整性、可读性、稳定性、开放性和工具性等 19 个门控。主要发现:同一探针在 Pi 中产生 1.5 KB 会话,在 Kimi Code 中约 101 KB;只有 Pi、OpenClaw 和 Kimi Code 标记了真正的会话格式/协议版本;一些 harness 保留可读推理,另一些存储密封推理或签名;一些记录美元成本,另一些仅保留 token 计数。Pi 得分 18/19,OpenClaw 17/18,Claude Code 和 Codex 并列 12/18。作者强调这不是编码质量排名,而是对编码代理基础设施中被忽视部分的报告卡。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →