Llama-3-8B 在规划基准测试中准确率跃升至 94%
mdancho84 · x · 2026-08-27
基准测试数据显示,Llama-3-8B 模型在规划基准上的准确率从 28% 跃升至 94%。这一显著提升标志着该模型涌现出了全新的能力,而非仅仅是渐进式的改进。
所属事件:MIT 新方法让 LLM 学会逻辑推理,规划准确率 28% 升至 94%(5 条相关)→
「模型」频道最新
- 开源模型反超:Kimi/GLM/Qwen 评分超 GPT-5.5 — solyarisoftware · 2026-08-27
- Sora 全面下线账号:用户被登出且无法重新登录 — Shrapnel_FEH · 2026-08-27
- 社区开源 Claude Mythos 理论复现架构 — Shruti_0810 · 2026-08-27
- Anthropic Opus 5 被吐槽无法理解“简短” — PtrPomorski · 2026-08-27
- 腾讯开源 WeMM-Embedding-9B,多模态嵌入模型登 HF 热榜 — tencent · 2026-08-27
- DeepSeek V4 与 Qwen 3.8 混部实测对比 — Legitimate_Hat_7852 · 2026-08-27