LisanBench 排行:测 LLM 推理与规则遵循能力
thisguyknowsai · x · 2026-08-21
LisanBench 是一个新的 LLM Word Chain 基准测试,旨在评估模型的基础推理能力。它要求模型构建尽可能长的非重复英语单词链,每词与前词仅差一个字母。该测试衡量模型的规则遵循、知识、规划、回忆和持久性。网站提供了详细的排行榜、时间线趋势、推理效率分析以及模型失败模式(如死胡同、重复、无效移动)的统计。
所属事件:LisanBench 发布:用单词链测试 LLM 推理与规则遵循(2 条相关)→
「研究」频道最新
- Karpathy:LLM将剥离百科知识,回归小型认知核心 — ZeroStateReflex · 2026-08-21
- Google DeepMind在Nature发表LLM水印技术论文 — burkov · 2026-08-21
- Marin利用Scaling Law预测训练轨迹,启动535B MoE — dlwh · 2026-08-21
- Sanmi Koyejo 谈 AI 测量、校准信任与复杂系统中的人的作用 — sanmikoyejo · 2026-08-21
- OpenCLIP 下个版本将支持 CLAP、CoCa 等多种多模态架构 — wightmanr · 2026-08-21
- LAWM-3D 负结果:多视角视频并不让潜动作学会 3D — andrew_n_carr · 2026-08-21