Glasshouse v0.1 发布:197 万 token 长对话记忆基准,2847 题不设总分
True_Mongoose_7073 · reddit · 2026-09-22
针对厂商记忆评测数字对不上、换评分模型比被测系统差距影响还大的痛点,开发者发布了开源记忆基准 Glasshouse v0.1。
设计要点:
- 规模:2847 道题嵌在一条最长达 197 万 token 的对话里,覆盖 10 种语言、50 张图片;对话分四个尺寸(1882 轮到 103572 轮),但承载答案的部分在所有版本中完全一致,从而能看出系统随历史变长何时崩塌。
- 多轴报告,无总分:各维度独立打分,因为系统可能一轴很强、另一轴无用。
- 超越简单召回:事实已更新却给出旧值的,不如老实说「不知道」;两条存储事实冲突且无法裁决时,指出冲突才是正确答案;还会检查系统是否承认「这事从没提过」。
目前提交榜为空,作者也未自行提交,公开征集社区运行测试、开 issue/PR,企业提交流程见仓库。
「研究」频道最新
- 谷歌 ScientistTwo 自动科研系统:107 道题攻克 80.4%,超人类 SOTA — thisdudelikesAI · 2026-09-22
- 腾讯混元推出 WebCraftBench:Agent 实测网页应用,人偏好匹配度 85.3% — TencentHunyuan · 2026-09-22
- Sarah Hooker 提议收 1 美元投稿费,测 AI 研究 agent — MannyKayy · 2026-09-22
- 曝 OpenAI 新模型训练仅 24 天已解决百余个数学开放难题 — BilelKort · 2026-09-22
- Boltzbit 预告论文:BAST 架构称 LLM 学习速度可达 SOTA 千倍 — jmhernandez233 · 2026-09-22
- MiMo v2.6 用 GRS 与 GAR 重定义 RL 里的「好答案」 — tokenbender · 2026-09-22