Kimi K3 en Modal: wat snellere AI-inference betekent voor je kosten

Kimi K3 en Modal: wat snellere AI-inference betekent voor je kosten

TL;DR

  • Wat: Moonshot AI lanceerde Kimi K3, een open-weights model met 2,8 biljoen parameters; Modal traint er een speciale DFlash-versneller voor die inference sneller maakt zonder kwaliteitsverlies.
  • Waarom relevant: snellere inference betekent lagere kosten per AI-verzoek — en open weights geven je als ondernemer meer keuze buiten de grote aanbieders.
  • Wat je ermee kunt: inventariseer of je huidige AI-leverancier al met open-weights modellen werkt, en vergelijk de kosten per token met wat je nu betaalt.

Ik stuitte op een tweet van Moonshot AI waarin ze Modal aankondigden als "Day 0 launch partner" voor hun nieuwe model Kimi K3. Wat mij triggerde was niet het model zelf — er verschijnt elke week wel iets nieuws — maar het feit dat Modal een op maat gemaakte versnellingstechniek heeft gebouwd specifiek voor de architectuur van K3. Dat zegt iets over hoe serieus de markt open-weights modellen begint te nemen.

Wat is Kimi K3 precies?

Kimi K3 is het nieuwste AI-model van het Chinese bedrijf Moonshot AI, dat op 16 juli 2026 werd gelanceerd. Het model heeft 2,8 biljoen parameters — dat is ruwweg drie keer zo groot als zijn voorganger K2.6. Om dat in perspectief te plaatsen: hoe meer parameters een model heeft, hoe meer "kennis" en nuance het in principe kan bevatten. Maar groter betekent ook trager en duurder om te draaien.

Wat K3 bijzonder maakt is de architectuur. Het gebruikt een zogeheten Mixture-of-Experts (MoE) aanpak, waarbij slechts 16 van de 896 beschikbare experts tegelijk actief zijn bij het verwerken van een vraag. Stel je een groot kantoor voor met 896 specialisten. Voor elke klantvraag hoef je er maar 16 aan het werk te zetten — de rest blijft op de bank. Dat houdt de rekenkracht beheersbaar ondanks het enorme totale model.

Daarnaast heeft K3 een contextvenster van 1 miljoen tokens. Dat betekent dat het model in één keer enorm veel tekst kan "lezen" en verwerken — denk aan complete handleidingen, contracten of codebases.

Hoe presteert het?

Volgens de benchmarks van Moonshot zelf scoort K3 boven Claude Opus 4.8 en GPT-5.5 High, maar onder Claude Fable 5 en GPT-5.6 Sol. Ik vind het eerlijk gezegd opvallend dat een open-weights model — dus een model waarvan je de gewichten gratis kunt downloaden — in dezelfde klasse speelt als de duurste gesloten modellen van Anthropic en OpenAI. Kanttekening: dit zijn zelfgerapporteerde cijfers van Moonshot, en onafhankelijke validatie is op dit moment nog beperkt.

Wat doet Modal en waarom is DFlash interessant?

Modal is een Amerikaans platform voor serverless GPU-infrastructuur. In gewone taal: je kunt er AI-modellen op draaien zonder zelf servers te beheren. Je betaalt per seconde, en als niemand je model aanroept, betaal je niets. Voor ondernemers die AI willen inzetten zonder een IT-afdeling op te tuigen is dat een relevant concept.

Voor de lancering van K3 heeft Modal een zogenaamde DFlash-speculator getraind die specifiek is afgestemd op de architectuur van K3. DFlash staat voor een techniek die "speculative decoding" heet. Het principe: in plaats van token voor token een antwoord te genereren (zoals je woord voor woord een zin typt), voorspelt een klein, snel hulpmodel meerdere tokens tegelijk. Het grote model controleert vervolgens of die voorspellingen kloppen. Wat klopt, wordt behouden. Wat niet klopt, wordt gecorrigeerd.

Het resultaat: je krijgt hetzelfde antwoord, maar sneller. Zonder kwaliteitsverlies.

De cijfers

Uit tests met vergelijkbare modellen (onder andere Qwen 3.5 122B) laat DFlash een versnelling van 4x tot 15x zien, afhankelijk van de taak en het model. Bij coderingstaken en wiskundige opgaven zijn de winsten het grootst. Bij K3 specifiek zijn er nog geen publieke benchmarks van Modal verschenen, maar de technologie is bewezen bij eerdere modellen in de Kimi-familie (K2.5 en K2.6) en bij modellen van Qwen en Llama.

Ik vind het interessant dat Modal hier niet zomaar een bestaand model host, maar actief investeert in het optimaliseren van een open-weights model. Dat is een signaal: de infrastructuurlaag concurreert niet alleen op prijs, maar op prestatie per model.

Wat betekent dit voor je als ondernemer?

Laat ik eerlijk zijn: de meeste MKB-ondernemers gaan Kimi K3 niet zelf draaien. Met 2,8 biljoen parameters heb je serieuze hardware nodig — zelfs met de efficiënte MoE-architectuur praat je over meerdere high-end GPU's. Dat is geen thuisproject.

Maar er zijn twee ontwikkelingen die wél direct relevant zijn.

1. Meer concurrentie drukt de prijs

Elk open-weights model dat op frontierniveau presteert, vergroot de concurrentie voor OpenAI, Anthropic en Google. Moonshot biedt K3 aan via hun eigen API voor $0,30 per miljoen tokens (cache-hit input) tot $15,00 per miljoen tokens (output). Dat is vergelijkbaar met wat de grote spelers vragen, maar het feit dat de gewichten open zijn betekent dat andere partijen — zoals Modal of Together AI — het model ook kunnen aanbieden. Concurrentie op hosting betekent uiteindelijk lagere prijzen.

Stel dat je als ondernemer een AI-chatbot draait voor klantenservice, of automatisch documenten laat samenvatten. Elke prijsdaling per token vertaalt zich direct in lagere maandkosten.

2. Snellere inference maakt nieuwe toepassingen praktisch

Versnelling door technieken als DFlash maakt het verschil tussen een AI-antwoord dat 3 seconden duurt en een dat in minder dan een seconde komt. Voor interne tools maakt dat misschien niet uit. Maar voor klantgerichte toepassingen — een chatbot op je website, een realtime vertaaltool, een assistent in je app — is dat wachttijd die je klanten wél voelen.

Kun je je voorstellen wat het betekent als je AI-assistent net zo snel reageert als een mens die typt? Dat is het type verschil waar we het over hebben.

De open-weights trend in perspectief

Wat mij opvalt aan de Kimi K3-lancering is niet zozeer het model op zich, maar het ecosysteem eromheen. Modal als day-0 partner. Together AI die ook direct hosting aanbiedt. DFlash-speculators die binnen uren beschikbaar zijn. Forbes schrijft erover als signaal van convergentie richting open-weights modellen.

Ik denk dat we op een kantelpunt zitten. Tot voor kort waren de beste AI-modellen exclusief beschikbaar via gesloten API's van een handvol grote bedrijven. Nu zie je dat open-weights modellen — waarvan je de gewichten kunt downloaden, aanpassen en zelf hosten — steeds dichter bij die top komen. Dat geeft bedrijven meer keuzevrijheid: je bent minder afhankelijk van één leverancier, je kunt eenvoudiger wisselen, en je hebt meer controle over waar je data naartoe gaat.

Tegelijkertijd: de hardwaredrempel blijft hoog. Zelf hosten is voor de meeste MKB-bedrijven geen optie. Maar via platforms als Modal wordt dat steeds laagdrempeliger. Je hoeft geen GPU's te kopen — je huurt ze per seconde.

Een verschuiving die langzaam zichtbaar wordt

Voor mij is de lancering van Kimi K3 met Modal als partner vooral een bevestiging van een trend die ik al langer volg: de AI-infrastructuurmarkt wordt volwassener, de prijzen dalen, en de keuze voor ondernemers wordt groter. Niet omdat één model alles verandert, maar omdat het speelveld breder wordt. En in een breder speelveld wint uiteindelijk de afnemer.

Wat mij betreft is het verstandig om als ondernemer niet blind te varen op één AI-leverancier, maar af en toe te checken wat er beschikbaar is — en tegen welke prijs. Niet om morgen te switchen, maar om te weten wat je opties zijn als de markt beweegt. Want die beweegt, dat is wel duidelijk.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.