博主实测 DeepSeek v4.1 flash 引争论:思考强度开关到底影不影响性能
karminski3 · x · 2026-09-14
博主 karminski3 实测 deepseek-v4.1-flash 时开 max 档,被评论指应开 high、思考强度只是开关与性能无关。他反驳称 DeepSeek 自家 R1 论文(arXiv:2501.12948)已证明思考强度越强模型能力越强:R1-Zero 通过 RL 未增加新知识,仅靠更长的思考就把 AIME24 跑分从 15% 提到 71%。他讽刺这些网友是「大水冲了自家龙王庙」。
「模型」频道最新
- 计算生物研究者实测:一个 Qwen3.8-27B 微调版工具调用最准,已退订 Claude — Usual-Carrot6352 · 2026-09-14
- 网友实测称神秘模型 instinct 体验胜过 Grok 与 Muse — Scobleizer · 2026-09-14
- Kokoro 语音模型移植 Core AI:54 种声音 iOS 端侧零成本运行 — amos_gyamfi · 2026-09-14
- Hacker Opus 之后多层模拟评测或已失效,研究者劝评估者慎用 — herbiebradley · 2026-09-14
- 黑客松观察:人人都在刷 benchmark,没人敢做真实场景 — hackgoofer · 2026-09-14
- 一周 AI 动态:Opus 5.2 传出泄密、GPT-6 Sol 首秀、DeepSeek Code 2.0 曝 3T 参数 — WorldofAI · 2026-09-14