数字母测试翻车不冤:Jev 逐字母输入 strawberry 时 168/168 全对
BLUECOW009 · x · 2026-09-22
redp314 对 @typesafeai 的 Jev 模型做经典 strawberry 数 r 测试:模型答错,47% 说 3 个、47% 说 2 个,与所有 LLM 一样在 168 个测试词中约 70% 会数错双写字母。
但把问题改为直接给字母序列 ["s","t","r","a","w","b","e","r","r","y"],同一模型、同一问题、260ms 内 168/168 全对——说明翻车根源在 tokenization 而非推理能力,作者讽刺这是「skill issue」。
「模型」频道最新
- 安全研究者算账:像前沿实验室那样测 ExploitBench 要烧 5930 万美元 API 费 — OwariDa · 2026-09-22
- 小米发布 Qwen 3.5 9B 蒸馏模型,用 MiMo 数据 SFT 并开源 RL 环境 — teortaxesTex · 2026-09-22
- The Information:OpenAI 内部已基本自动化实验模型训练流程,新模型解出 100 道悬置数学难题 — kimmonismus · 2026-09-22
- 实测 Grok 4.7 音乐错误检测满分,比肩 GPT-6 Astra — yunta_tsai · 2026-09-22
- MiMo-V2.6 被称最大开源 RL 单次训练,登顶开源模型 — andrew_n_carr · 2026-09-22
- 开发者吐槽 AI 编码最大痛点:模型还是太蠢、太慢、太贵 — remilouf · 2026-09-22