主流大模型在简单字母重组任务上频现“脑冻结”
HydronautInSpace · reddit · 2026-08-20
用户测试了 Gemini、ChatGPT、DeepSeek 和 Claude 在一个简单语言任务上的表现:用字母 'a n g r y n' 组成 6 字母单词。结果显示,除了 Claude 正确回答外,其他模型均出现错误或“脑冻结”,引发了关于 LLM 语言处理能力的讨论。
「模型」频道最新
- 腾讯计划发布更大参数多模态模型 Hy4 — zephyr_z9 · 2026-08-20
- 腾讯混元 Hy4 模型开启灰度测试,定位专家级 — Nunki08 · 2026-08-20
- 花 250 美元复现 Mini Kimi-K3,性能超越 GPT-2 — OtherRaisin3426 · 2026-08-20
- 用户仅用 Luna Max 模型数小时耗尽 Codex 配额 — Al_Grigor · 2026-08-20
- 实测 Qwen 2.5 72B 参加 ACT 考试:阅读满分,综合 36 分 — on_line187 · 2026-08-20
- Claude 挑战黎曼猜想未果但获数学突破 — PtrPomorski · 2026-08-20