DeepSeek-V4-Flash Hits Ollama Cloud with 120+ Output Tokens/sec
zhyncs42 · x · 2026-08-11
Ollama has fully rolled out DeepSeek-V4-Flash on its cloud platform. The model combines speed, efficiency, and frontier-level performance, achieving 120+ output tokens/sec on Ollama's cloud.
It features open weights and zero data retention hosting in the US and Europe. Pro and Max plan users get generous usage allowances to support long-running, uninterrupted sessions for coding harnesses.
More from Models
- Meta Releases Muse Glimmer: A 30B Open-Weight Model for Local Agent Workflows — BLUECOW009 · 2026-08-11
- Web Design Benchmark: Muse Glimmer 30B vs. Qwen 3.6 27b vs. DeepSeek — ShadyShroomz · 2026-08-11
- Muse Glimmer Local Coding Test: Runs on 20GB RAM, Lags Behind Qwen — curiousily_ · 2026-08-11
- Perplexity Agent API Integrates Kimi K3 with Automated Data Story Workflow — AravSrinivas · 2026-08-11
- Renaming a PDF Boosts LLM Scores: A Weird Flaw in AI Evaluation — generativist · 2026-08-11
- DeepSeek Open-Sources DeepSeek-OCR 2: Visual Causal Flow for Markdown Conversion — tom_doerr · 2026-08-11