TL;DR
- Wat: Ollama meldt dat DeepSeek-V4-Flash op hun cloudplatform meer dan 200 tokens per seconde haalt, met zero data retention (je data wordt niet opgeslagen of gebruikt).
- Waarom relevant: als ondernemer krijg je hiermee toegang tot een krachtig open-source AI-model zonder eigen hardware, én zonder dat je bedrijfsdata wordt bewaard.
- Wat je ermee kunt: bekijk of Ollama Cloud (gratis tier beschikbaar) geschikt is voor taken waar je nu betaalde API's als ChatGPT of Claude voor gebruikt.
Ik scrollde afgelopen weekend door X en viel over een bericht van Ollama: hun clouddienst draait nu DeepSeek-V4-Flash met meer dan 200 tokens per seconde outputsnelheid, met zero data retention. Dat zijn twee claims in één zin die allebei de moeite waard zijn om even uit te pakken.
Wat is DeepSeek-V4-Flash precies?
DeepSeek-V4-Flash is een AI-taalmodel van het Chinese bedrijf DeepSeek, uitgebracht in april 2026. Het model heeft 284 miljard parameters in totaal, maar gebruikt er slechts 13 miljard tegelijk — een architectuur die "Mixture of Experts" (MoE) heet. Vergelijk het met een groot kantoor waar 284 specialisten werken, maar er voor elke vraag slechts 13 tegelijk aan de slag gaan. Dat maakt het model snel én zuinig.
Verder heeft het een contextvenster van 1 miljoen tokens. In gewone taal: je kunt het model in één keer een enorme hoeveelheid tekst voeren — denk aan honderden pagina's — en het houdt de draad vast. De licentie is MIT, wat betekent dat iedereen het model mag gebruiken, ook commercieel.
Wat mij opvalt: eind juli bracht DeepSeek een bijgewerkte versie uit (de 0731-variant) die op alle negen gepubliceerde agent-benchmarks beter scoorde dan hun eigen duurdere V4-Pro-Preview-model. Een budgetmodel dat het vlaggenschip verslaat — dat zie je niet elke dag.
200 tokens per seconde — wat betekent dat?
Ollama claimde eerder al 100+ tokens per seconde voor dit model. Nu melden ze 200+ tps. Om dat in perspectief te plaatsen: een gemiddeld Nederlands woord is ruwweg anderhalf token. Bij 200 tokens per seconde genereert het model dus zo'n 130 woorden per seconde. Deze hele blogpost zou in minder dan tien seconden uit het model kunnen rollen.
Voor de meeste ondernemerstoepassingen — een e-mail laten samenvatten, een productbeschrijving genereren, een intern document analyseren — is dat meer dan snel genoeg. Sterker nog: bij die snelheden wordt de wachttijd zo kort dat je AI realistisch kunt inzetten in werkprocessen waar mensen anders ongeduldig afhaken.
Hoe bereiken ze die snelheid?
Ollama host deze modellen via NVIDIA Cloud Providers op Blackwell-GPU's. Wanneer je het commando ollama run deepseek-v4-flash:cloud uitvoert, fungeert je lokale Ollama-installatie als een soort doorgeefluik: je verzoek gaat naar Ollama's servers, wordt daar verwerkt, en het antwoord komt terug. Je hoeft zelf geen dure GPU te hebben.
Zero data retention — wat houdt dat in?
Dit is voor mij het interessantere deel van het verhaal. Zero data retention (ZDR) betekent dat Ollama contractueel vastlegt dat je prompts en antwoorden niet worden opgeslagen, niet worden gelogd, en niet worden gebruikt om modellen te trainen. Ze eisen datzelfde van hun hostingpartners.
Voor Nederlandse ondernemers die worstelen met de vraag "mag ik dit wel gebruiken voor bedrijfsdata?" is dit relevant. Bij veel commerciële AI-diensten is het onduidelijk wat er met je input gebeurt. Ollama zegt: niets. Geen logging, geen training, geen opslag.
Een kanttekening
Ik wil hier eerlijk zijn: zero data retention is een belofte, geen natuurwet. Het is een contractuele afspraak tussen Ollama en hun infrastructuurpartners. Ollama's eigen privacybeleid adviseert voorzichtigheid bij vertrouwelijke werklasten via externe infrastructuur. En zoals bij elke clouddienst geldt: data kan in theorie worden gevorderd door autoriteiten. Voor de meeste MKB-toepassingen is ZDR een sterke privacygarantie, maar voor écht gevoelige data — denk aan medische dossiers of juridische stukken — zou ik zelf willen weten welke jurisdictie van toepassing is.
Wat kost het en hoe toegankelijk is het?
Ollama Cloud heeft drie prijsniveaus: een gratis tier, Pro voor 20 dollar per maand, en Max voor 100 dollar per maand. Op de gratis tier kun je al met cloudmodellen werken, zij het met beperkte capaciteit. Pro geeft je vijftig keer meer cloudgebruik en toegang tot drie cloudmodellen tegelijk.
Kun je je voorstellen wat dit betekent als je een webshop runt en dagelijks productbeschrijvingen moet schrijven? Of als je een adviesbureau hebt en klantdocumenten wilt samenvatten? Voor 20 dollar per maand heb je toegang tot een model dat op benchmarks concurreert met de duurdere opties, zonder dat je in hardware hoeft te investeren.
Lokaal draaien blijft ook een optie
Wat ik waardevol vind aan Ollama's aanpak: lokaal draaien is en blijft onbeperkt en gratis. Als je wél eigen hardware hebt — een stevige laptop of een server met een GPU — kun je hetzelfde model volledig op je eigen machine draaien. Dan verlaat je data nooit je netwerk. Voor bedrijven die onder de AI Act als hoog-risico worden aangemerkt (denk aan HR-selectie of kredietbeoordeling), kan dat een relevante overweging zijn.
Wat betekent dit voor de Nederlandse ondernemer?
Er zijn twee dingen die mij opvallen aan dit verhaal.
Ten eerste: de drempel om een krachtig AI-model te gebruiken wordt steeds lager. Je hebt geen datawetenschapper nodig, geen eigen servers, geen groot budget. Een gratis account en een terminalvenster volstaan om te beginnen.
Ten tweede: de privacyvraag verschuift. Het gesprek gaat niet meer alleen over "is AI goed genoeg?" maar over "onder welke voorwaarden gebruik ik het?". Zero data retention is een antwoord op die vraag — niet het enige antwoord, maar wel een concreet antwoord.
Ik denk dat we een fase ingaan waarin de keuze voor een AI-model steeds meer lijkt op de keuze voor een boekhoudsoftwarepakket: het gaat niet alleen om de functies, maar ook om de voorwaarden, de hosting, en wat er met je data gebeurt. Voor ondernemers die dat serieus nemen, is het goed om te weten dat er opties zijn die privacy expliciet als uitgangspunt nemen.
Voor mij is dit vooral een signaal dat open-source AI-modellen niet alleen technisch concurrerend zijn geworden, maar ook qua gebruiksgemak en privacygaranties steeds dichter bij de behoefte van gewone bedrijven komen.
80% van de AI-projecten haalt productie nooit.
Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.