用「Trickle Test」评测用户模型:像人一样循序渐进释放信息
gharik · x · 2026-09-11
niloofarmire 团队发布博客、模型与评测,其中她花大量时间构建的「Trickle Test」值得注意:衡量不同用户模型的信息披露节奏与真人的差异。
核心区分是:「benchmaxxed」的助手模型倾向在第一轮就把信息全部倾倒出来,而好的用户模型应当像人一样循序渐进地逐步透露信息。该评测为用户模型这一新类别提供了具体可量化的评估视角。
「模型」频道最新
- DeepSeek V4.1 登顶 Vals 开源模型榜,每次测试仅 0.3 美元 — teortaxesTex · 2026-09-11
- 日常编码真需要旗舰模型吗?开发者和 80% 时间用中等档位 — iamaliveix · 2026-09-11
- OpenAI 平台疑似上线托管 Agents 功能:环境、模板、会话已可创建 — testingcatalog · 2026-09-11
- 30B 开源模型 OpenResearcher 在 BrowseComp-Plus 超 GPT-4.1 — TheZachMueller · 2026-09-11
- Surge 评测四大新模型:Fable 5.1 综合第一得 68.7 分 — echen · 2026-09-11
- OpenAI 暂停 200 美元/月 ChatGPT Pro 新订阅,取消后难再回来 — mark_k · 2026-09-11