DeepSeek V4-Flash scoort 54 op DeepSWE — de Pro kwam niet verder dan 8

TL;DR

  • Wat: DeepSeek lanceert V4-Flash-0731 als publieke bèta; het model scoort 54,4 op de DeepSWE-benchmark voor softwareontwikkeling, waar de grotere V4-Pro-Preview bleef steken op 8 punten.
  • Waarom relevant: AI-modellen die zelfstandig code schrijven worden snel beter én goedkoper — dat raakt de kosten en snelheid van softwareprojecten.
  • Wat je ermee kunt: Evalueer of je ontwikkelteam of IT-partner al experimenteert met AI-codeeragenten, en tegen welke kosten.

Ik viel vanochtend over een tweet van @chetaslua die één getal uitlichtte: 54,4 op DeepSWE. Dat klinkt misschien abstract, maar als je weet dat de vorige, grotere variant van hetzelfde bedrijf op diezelfde test op 8 bleef hangen, wordt het ineens een heel ander verhaal. Ik wilde snappen wat hier precies aan de hand is — en waarom het voor ondernemers relevant kan zijn.

Wat is er precies gelanceerd?

DeepSeek, het Chinese AI-bedrijf dat eerder dit jaar al opviel met zijn V4-modellen, heeft vandaag — 31 juli 2026 — de officiële versie van V4-Flash als publieke bèta vrijgegeven. Het gaat om een update van het API-model, dus de versie die ontwikkelaars via code aanroepen. De app en website van DeepSeek draaien voorlopig nog op de oude modellen.

Technisch gezien is V4-Flash een zogeheten Mixture-of-Experts-model (MoE): het heeft in totaal 284 miljard parameters, maar activeert er slechts 13 miljard tegelijk. Vergelijk het met een groot kantoor waar 284 medewerkers zitten, maar per vraag steeds een klein team van 13 specialisten wordt ingezet. Dat maakt het model snel en goedkoop in gebruik.

Wat mij opvalt: de architectuur is niet veranderd ten opzichte van de preview-versie. DeepSeek heeft het model alleen opnieuw getraind — specifiek gericht op zogeheten "agent-taken", waarbij het model zelfstandig stappen uitvoert in plaats van alleen antwoord te geven op een vraag.

DeepSWE: waarom die benchmark ertoe doet

DeepSWE is een relatief nieuwe benchmark, ontwikkeld door Datacurve. Het meet hoe goed een AI-model zelfstandig softwaretaken kan uitvoeren — denk aan het lezen van een bugrapport, het doorzoeken van een codebase, het doorvoeren van wijzigingen in meerdere bestanden, en het controleren of de oplossing daadwerkelijk werkt.

Het verschil met oudere benchmarks zoals SWE-bench is dat de taken in DeepSWE helemaal nieuw geschreven zijn. Geen enkel model heeft de oplossingen eerder gezien tijdens training. Er zitten 113 taken in, verspreid over vijf programmeertalen (TypeScript, Go, Python, JavaScript en Rust), en de oplossingen vereisen gemiddeld 5,5 keer meer code dan bij SWE-bench Pro.

Kort gezegd: DeepSWE simuleert het echte werk van een softwareontwikkelaar, niet een examenopdracht.

De scores in perspectief

Op de DeepSWE-ranglijst staan de beste modellen rond de 70-74%. Claude Opus 5 van Anthropic leidt met 74%, gevolgd door GPT-5.6 Sol van OpenAI met 73%. DeepSeek V4-Flash komt met 54,4% niet in de buurt van die top, maar de sprong vanaf de 8 punten van V4-Pro-Preview is enorm.

Ik vind het eerlijk gezegd opvallend dat een kleiner, goedkoper model zo ver boven zijn grotere broer uitkomt. Dat is alsof de budgetversie van een auto ineens beter presteert dan het topmodel — puur door een betere training.

Wat kost het en hoe verhoudt het zich?

De prijzen van V4-Flash via de DeepSeek API liggen op dit moment op roughly $0,14 per miljoen input-tokens en $0,28 per miljoen output-tokens. Met caching — een techniek waarbij veelvoorkomende invoer wordt hergebruikt — daalt de inputprijs naar $0,0028 per miljoen tokens. Dat is een kostenverlaging van 98%.

Ter vergelijking: topmodellen zoals Claude Opus of GPT-5.6 kosten doorgaans een veelvoud daarvan. Voor ondernemers die software laten ontwikkelen of AI-tools inzetten, is dit verschil substantieel. Stel dat je als ondernemer een interne tool laat bouwen en je ontwikkelaar zet een AI-codeeragent in: het verschil tussen een premium model en V4-Flash kan in een groot project honderden euro's per maand schelen.

Ik moet hierbij wel een kanttekening plaatsen. Een lagere prijs betekent ook lagere kwaliteit op sommige taken. Op de DeepSWE-ranglijst staat V4-Flash nog ruim 20 procentpunten achter de koplopers. De vraag is dus niet "is dit het beste model?", maar "is dit model goed genoeg voor wat ik nodig heb?"

Wat betekent dit voor een ondernemer?

Laat ik eerlijk zijn: de meeste MKB-ondernemers gaan niet zelf een API aanroepen. Maar deze ontwikkeling werkt wél door in de tools die je gebruikt of laat bouwen.

Softwareontwikkeling wordt goedkoper

AI-codeeragenten worden steeds beter in het zelfstandig oplossen van programmeertaken. Dat betekent niet dat ontwikkelaars overbodig worden, maar wel dat een ontwikkelaar met de juiste AI-tools meer werk kan verzetten. Als je een softwarebureau inhuurt voor een project, is het zinvol om te vragen of en hoe zij AI-agenten inzetten — en wat dat voor de prijs betekent.

De kosten van AI-modellen dalen snel

Een model dat een paar maanden geleden nog als premium gold, wordt nu overtroffen door een goedkoper alternatief. Dit patroon herhaalt zich steeds sneller. Voor ondernemers die AI-kosten budgetteren — bijvoorbeeld voor klantenservice-chatbots, documentverwerking of interne tools — is het verstandig om niet vast te zitten aan één leverancier. Flexibiliteit in modelkeuze kan direct geld besparen.

Klein verslaat groot

Dit is misschien wel het meest interessante patroon: V4-Flash (13 miljard actieve parameters) verslaat V4-Pro-Preview (een veel groter model) op agent-taken. Dat suggereert dat gerichte training op specifieke vaardigheden belangrijker wordt dan rauwe modelgrootte. Kun je je voorstellen wat dit betekent als die trend doorzet? Het zou de drempel om AI in te zetten voor kleinere bedrijven verder kunnen verlagen.

Een nuance die erbij hoort

Ik wil wel benadrukken dat benchmarks niet het hele verhaal vertellen. Een score op DeepSWE zegt iets over geïsoleerde programmeertaken in een testomgeving. Hoe een model presteert in de dagelijkse praktijk — met rommelige codebases, onduidelijke opdrachten en onverwachte randgevallen — is een ander verhaal. Bovendien is deze versie net vandaag gelanceerd als bèta. De cijfers zullen door onafhankelijke partijen nog geverifieerd moeten worden.

Wat mij betreft is dit vooral een signaal dat de prijs-prestatieverhouding van AI-codeertools in een stroomversnelling zit. De vraag is niet meer óf AI een rol speelt bij softwareontwikkeling, maar hoe snel de kosten dalen tot een punt waarop het voor vrijwel elk bedrijf toegankelijk wordt.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.