开发者发布首人称 Agent 记忆评测基准 Exam

LowDistribution3995 · reddit · 2026-08-26

作者正在构建一个基于第一人称视角的 Agent 记忆评测基准。语料库包含约 50 万 token、近 60 个会话,测试范围涵盖召回、多跳链接、时序推理、事实覆盖、说话人陷阱、拒绝、可信度和 Agent 工具使用等 10 个类别。测试包含脚本化交互对话记录,并提供烟雾工具用于模拟多任务评估。每个测试会生成包含可视化图表和漏项报告的成绩单。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →