新基准Session-Bench:评估10种编码harness的会话保留能力,Pi得分18/19
jazzy8alex · reddit · 2026-08-15
Session-Bench 是一个新的 agentic benchmark,评估编码 harness 在任务完成后保留会话记录的能力。它比较了 10 种 CLI 会话格式,涵盖完整性、可读性、稳定性、开放性和工具性等 19 个门控。主要发现:同一探针在 Pi 中产生 1.5 KB 会话,在 Kimi Code 中约 101 KB;只有 Pi、OpenClaw 和 Kimi Code 标记了真正的会话格式/协议版本;一些 harness 保留可读推理,另一些存储密封推理或签名;一些记录美元成本,另一些仅保留 token 计数。Pi 得分 18/19,OpenClaw 17/18,Claude Code 和 Codex 并列 12/18。作者强调这不是编码质量排名,而是对编码代理基础设施中被忽视部分的报告卡。
「编程与Agent」频道最新
- 开源项目 Munder Difflin:打造美观强大的终端 Agent — chaitanyagiri · 2026-08-15
- 智能体沙箱逃逸检测框架:六步监控与红队测试 — blaizedsouza · 2026-08-15
- 多智能体系统是下一代抽象,或将造就超级智能 — scaling01 · 2026-08-15
- Grok 4.6 现已集成至 GitHub Copilot — intellectronica · 2026-08-15
- AQuA 论文:量化交易中的递归自我改进 Agent — MengdiWang10 · 2026-08-15
- 如何构建最强大的 AI 编码系统:AI 暗工厂全拆解 — Cole Medin · 2026-08-15