DeepSeek V4 Flash is nu standaard op Ollama Cloud

TL;DR

  • Wat: DeepSeek V4 Flash 0731 is uitgerold als standaardmodel op Ollama Cloud, met 120+ tokens per seconde en nul dataopslag in de VS en Europa.
  • Waarom relevant: als ondernemer kun je nu een krachtig AI-model inzetten via een cloudplatform dat expliciet belooft je data niet te bewaren.
  • Wat je ermee kunt: bekijk of Ollama Cloud (vanaf $20/maand) een alternatief is voor je huidige AI-tooling, vooral voor code- en agenttaken.

Ik stuitte deze week op een aankondiging van Ollama die me deed stilstaan. DeepSeek V4 Flash — een AI-model van het Chinese DeepSeek — is nu het standaardmodel op Ollama's cloudplatform. Wat me opvalt is niet zozeer het model zelf, maar de combinatie van snelheid, prijs en de nadrukkelijke belofte rond privacy.

Wat is DeepSeek V4 Flash precies?

DeepSeek V4 Flash is een zogeheten Mixture-of-Experts-model. Dat klinkt technisch, maar het idee is eigenlijk elegant: het model heeft in totaal 284 miljard parameters (zeg maar de "kennis-eenheden" van het model), maar activeert er bij elke vraag slechts 13 miljard. Vergelijk het met een groot kantoorgebouw waar op elk moment maar een handvol verdiepingen verlicht is — je hebt de capaciteit van het hele pand, maar je verbruikt alleen energie voor wat je nodig hebt.

Het resultaat is een model dat opvallend snel werkt. Ollama claimt meer dan 120 tokens per seconde op hun cloudinfrastructuur. Ter vergelijking: bij veel andere modellen zit je eerder rond de 30 tot 60 tokens per seconde. In de praktijk betekent dat kortere wachttijden als je het model een vraag stelt of een stuk tekst laat genereren.

Daarnaast heeft het model een contextvenster van één miljoen tokens. Dat is het "werkgeheugen" — hoeveel tekst het model in één keer kan meenemen. Voor de meeste dagelijkse taken heb je dat niet nodig, maar als je bijvoorbeeld een lang document wilt laten samenvatten of een uitgebreide codebasis wilt analyseren, is dat een flinke ruimte.

De benchmarks: wat zeggen de cijfers?

DeepSeek publiceerde op 31 juli de 0731-versie van V4 Flash, en de benchmarkresultaten zijn opvallend. Het model scoort 82,7 op TerminalBench 2.1 — een test voor agenttaken, waarbij het model zelfstandig stappen moet zetten om een probleem op te lossen. Ter vergelijking: DeepSeeks eigen, duurdere V4-Pro-Preview scoorde daar 72,1. Een lichter en goedkoper model dat beter presteert dan het zwaardere broertje — dat zie je niet vaak.

Op coderingstaken staat het model in de top 25% van alle geteste modellen, en het scoort 54,4 op DeepSWE, een benchmark voor het oplossen van softwareproblemen.

Nu moet ik daar eerlijk bij zeggen: benchmarks zijn nuttige indicatoren, maar ze vertellen niet het hele verhaal. Hoe een model presteert op jouw specifieke taken — een klantenservicevraag beantwoorden, een offerte samenvatten, een stuk code debuggen — kan afwijken van wat een benchmark laat zien. Ik zou zeggen: de cijfers zijn indrukwekkend, maar je eigen ervaring is de echte test.

Privacy en dataopslag: waarom dit ertoe doet

Wat mij hier het meest opvalt, is de nadruk die Ollama legt op zero data retention — nul dataopslag. Ze bieden hosting aan in de VS en Europa, en beloven dat je data niet bewaard wordt na verwerking.

Voor Nederlandse ondernemers is dat een relevant punt. Als je AI-tools inzet voor bedrijfsprocessen — denk aan het analyseren van contracten, het beantwoorden van klantvragen, of het schrijven van interne rapporten — dan wil je weten waar je data naartoe gaat. Zeker met de Europese AI Act in het achterhoofd.

Ik vind het interessant dat Ollama hier zo nadrukkelijk mee adverteert. Het laat zien dat privacygaranties steeds meer een verkoopargument worden in de AI-markt. Of die belofte in de praktijk waterdicht is, hangt af van de voorwaarden en de technische implementatie — dat is iets om zelf te controleren voordat je er gevoelige bedrijfsdata doorheen stuurt.

Mag je DeepSeek gebruiken als Nederlands bedrijf?

Kort antwoord: ja, voor de meeste toepassingen wel. Maar er zijn uitzonderingen. Als je AI inzet voor zogeheten hoog-risicotoepassingen — denk aan personeelsselectie of kredietbeoordelingen — dan gelden er strengere eisen vanuit de AI Act. In die gevallen moet je extra maatregelen nemen, ongeacht welk model je gebruikt.

Wat kost het?

Ollama Cloud werkt met drie abonnementen. Er is een gratis tier, een Pro-plan voor $20 per maand, en een Max-plan voor $100 per maand. Het Pro-plan geeft je toegang tot de cloudmodellen met redelijke gebruikslimieten. Het Max-plan biedt vijf keer zoveel capaciteit en is bedoeld voor zwaardere, doorlopende taken — bijvoorbeeld als je een AI-agent hebt die continu code schrijft of documenten verwerkt.

Een kanttekening: op het moment van schrijven zijn nieuwe Max-abonnementen gepauzeerd omdat Ollama capaciteit aan het bijschalen is. Dat is enerzijds vervelend als je nu wilt instappen, anderzijds een signaal dat er flinke vraag is naar dit soort diensten.

Kun je je voorstellen wat het betekent als je voor $20 per maand toegang hebt tot een model dat op codeertaken beter presteert dan modellen die een veelvoud kosten? Voor een MKB-ondernemer die software laat ontwikkelen of zelf met code werkt, is dat een interessante verschuiving.

Zelf hosten: een optie?

Voor de volledigheid: je kunt DeepSeek V4 Flash ook zelf draaien via Ollama's software. Maar dan heb je meerdere high-end GPU's nodig met honderden gigabytes aan videogeheugen. Voor de meeste MKB-bedrijven is dat geen realistische optie. De cloudvariant is dan de praktische keuze.

Drie denkmodi: van snel naar diep

Een detail dat me opviel: het model biedt drie "denkmodi". Een snelle modus voor directe antwoorden zonder uitgebreid redeneren, een standaard denkmodus voor logische analyse, en een maximale denkmodus voor de lastigste problemen. Dat is handig omdat je als gebruiker kunt kiezen hoeveel rekentijd je wilt besteden aan een vraag. Een simpele vertaling hoeft niet door dezelfde molen als een complexe data-analyse.

Waar dit op wijst

Voor mij is dit vooral een signaal dat de AI-markt in een fase zit waarin modellen steeds sneller, goedkoper en toegankelijker worden — en waarin privacy niet langer een bijzaak is maar een kernonderdeel van het aanbod. Een open model uit China, gehost op Europese en Amerikaanse servers met een expliciete privacybelofte, aangeboden voor twintig dollar per maand. Dat was twee jaar geleden ondenkbaar.

Ik denk dat het voor ondernemers verstandig is om dit soort ontwikkelingen in de gaten te houden. Niet om morgen alles om te gooien, maar om te weten welke opties er zijn als je huidige AI-tooling te duur wordt, te traag is, of niet aan je privacy-eisen voldoet.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.