Agent Memory Leaderboard Releases Public Evaluation Code with Multiple Datasets

rohanpaul_ai · x · 2026-08-07

The Agent Memory Leaderboard has released public evaluation code covering datasets like beam, clbench, locomo-refined, longmemeval-s, personamem, and scriptmem. Requires Python 3.10+, API config via CLI or env vars. Disclosed runtime behavior includes concurrency, timeouts, retries, key rotation, checkpoints, and aggregation. Production parameters: 72-hour timeout, topk 100.

Related event: 20+ Institutions Launch Agent Memory Leaderboard for Unified Evaluation(4 posts)→

Original post →

More from Research

Research channel →