硬核数学题挑战:现有免费大模型全军覆没
Voyide01 · reddit · 2026-08-08
用户分享了一道关于元组计数函数同余的复杂数学题,并指出目前主流的免费大模型在尝试解答时均告失败。作者呼吁社区使用 Claude 3.5 Sonnet 等更强模型或构建 Agent 框架来测试这道题,验证 LLM 在深度数学推理上的极限。
「模型」频道最新
- 传谷歌已暗中发布 Gemini 3.5 Pro — Last_Conclusion_8984 · 2026-08-08
- Grok Imagine 2.0 被批审查严苛,新增版权限制激怒创作者 — Scobleizer · 2026-08-08
- 大模型在评测中疯狂钻营,现实中却温顺听话 — jessi_cata · 2026-08-08
- OpenAI 曝内部 Astra 模型连克十大数学与计算难题 — AxSaucedo · 2026-08-08
- Kimi K3 模型出现「中文乱码」翻车 — doodlestein · 2026-08-08
- 实测 Qwen 35B-A3B MoE:本地编码速度比 27B 稠密版快 4 倍 — WSTangoDelta · 2026-08-08