TL;DR
- Wat: Het open-source AI-model Kimi K3 (2,8 biljoen parameters) draait vanaf dag één op 423 tokens per seconde via het SGLang-framework — met speculative decoding.
- Waarom relevant: Het grootste open AI-model ter wereld is nu snel genoeg voor productie-inzet, wat de keuze tussen open en gesloten modellen voor bedrijven verschuift.
- Wat je ermee kunt: Evalueer of een open model als K3 via een cloudprovider (Google Cloud, RunPod, DeepInfra) voor jouw AI-toepassingen een alternatief is voor gesloten API's.
Ik viel afgelopen weekend over een bericht van LMSYS — de organisatie achter het SGLang-framework — dat ze op dag één al 423 tokens per seconde halen met Kimi K3, het grootste open-source taalmodel dat er op dit moment is. Dat is snel. En het zegt iets over waar de markt naartoe beweegt.
Wat is Kimi K3 precies?
Kimi K3 is een AI-model van het Chinese bedrijf Moonshot AI, uitgebracht op 16 juli 2026. Het telt 2,8 biljoen parameters — bijna drie keer zoveel als zijn voorganger K2.6. Dat klinkt als een abstract getal, dus laat me het vergelijken: de meeste taalmodellen die je als ondernemer via een API gebruikt (denk aan GPT-4, Claude) zitten ergens in die orde van grootte, maar hun gewichten zijn niet openbaar. Bij K3 zijn die gewichten wél vrij beschikbaar onder een Modified MIT-licentie.
Het model gebruikt een zogenaamde Mixture-of-Experts architectuur (MoE). Stel je een bedrijf voor met 896 specialisten, maar je schakelt er per vraag slechts 16 in — precies degenen die het meest relevant zijn. Dat is in essentie hoe MoE werkt: het model is enorm, maar activeert per verzoek slechts een fractie van zijn capaciteit. Daardoor blijft het haalbaar om het te draaien zonder dat je een compleet datacenter nodig hebt.
Wat mij opvalt is het contextvenster: K3 kan tot 1.048.576 tokens verwerken in één sessie. Dat is ruwweg het equivalent van een boek van 700 pagina's. Voor ondernemers die met grote hoeveelheden tekst werken — contracten, rapporten, technische documentatie — is dat een relevante eigenschap.
Waarom 423 tokens per seconde bijzonder is
Het snelheidscijfer uit de tweet verdient wat context. De 423 tokens per seconde is gemeten met een techniek die DSpark heet — een vorm van speculative decoding. Dat werkt zo: een klein, snel hulpmodel genereert alvast een reeks woorden, en het grote model controleert die in één keer. Klopt de voorspelling? Dan win je tijd. Klopt het niet? Dan corrigeert het grote model.
Zónder die techniek haalt K3 ongeveer 113 tokens per seconde. Dat is al behoorlijk voor een model van deze omvang, maar met DSpark verviervoudigt het nagenoeg. Om het in perspectief te plaatsen: 423 tokens per seconde betekent dat je in één seconde een complete alinea tekst kunt genereren. Voor toepassingen waar snelheid ertoe doet — klantenservice-chatbots, realtime samenvatting, codeassistentie — is dat het verschil tussen bruikbaar en onbruikbaar.
Ik vind het eerlijk gezegd indrukwekkend dat dit op dag één werkt. Normaal gesproken duurt het weken tot maanden voordat een nieuw model geoptimaliseerd draait op een serving-framework. Dat SGLang dit klaar had bij de release van K3 wijst op nauwe samenwerking tussen de teams.
De techniek onder de motorkap
Voor wie iets dieper wil kijken: SGLang heeft flink moeten sleutelen om K3 snel te krijgen. Het model combineert twee typen aandachtsmechanismen — 69 lagen met Kimi Delta Attention (KDA, een vorm van lineaire aandacht) en 24 lagen met Multi-Latent Attention (MLA). Die combinatie is nieuw en vereiste aanpassingen op meerdere niveaus.
Een paar highlights:
Geheugenbeheer
SGLang gebruikt een unified memory pool die KDA-blokken en MLA-cachegeheugen dynamisch verdeelt. Dat klinkt technisch, maar het komt erop neer dat het systeem slimmer omgaat met het werkgeheugen van de GPU — vergelijkbaar met hoe een goed magazijnsysteem ervoor zorgt dat je niet telkens heen en weer hoeft te lopen.
Parallellisme
Voor het voorbereiden van antwoorden (prefill) wordt chunked pipeline parallelism ingezet over 8 GPU's, waarbij 91% van de communicatietijd verborgen wordt. Voor het daadwerkelijk genereren van tekst (decode) wordt een techniek gebruikt die de effectieve geheugencapaciteit bijna 8x vergroot.
Reinforcement Learning
SGLang biedt ook directe ondersteuning voor het verder trainen van K3 met reinforcement learning. In een test verbeterde de score op een wiskundebenchmark (AIME-2024) van 43,3% naar 76,7% in twaalf uur. Voor bedrijven die een model willen afstemmen op eigen data of taken is dat relevant.
Wat betekent dit voor ondernemers?
Kun je je voorstellen dat het krachtigste open AI-model nu beschikbaar is via meerdere cloudproviders — Google Cloud, DigitalOcean, RunPod, DeepInfra, Nebius — en dat je het zonder licentiekosten voor het model zelf kunt inzetten?
Dat is precies de situatie. En ik denk dat het voor MKB-eigenaren drie dingen betekent:
1. Meer keuzevrijheid. Tot voor kort was je voor topmodellen aangewezen op een handvol gesloten API's. Nu kun je een vergelijkbaar model draaien bij de provider van je keuze, of zelfs op eigen infrastructuur als je de hardware hebt. Dat geeft onderhandelingsruimte én vermindert vendor lock-in.
2. Prijsdruk op AI-API's. Hoe meer krachtige open modellen er zijn, hoe lastiger het wordt voor aanbieders van gesloten modellen om hoge prijzen te vragen. Dat is goed nieuws als je AI-kosten wilt beheersen.
3. De lat voor 'goed genoeg' verschuift. Een model met een contextvenster van een miljoen tokens, dat 423 tokens per seconde genereert, is voor veel zakelijke toepassingen ruim voldoende. De vraag verschuift van "is er een model dat dit kan?" naar "welke implementatie past het best bij mijn situatie?"
Een kanttekening: het draaien van een model met 2,8 biljoen parameters vereist nog steeds serieuze GPU-capaciteit. Je praat over meerdere high-end GPU's — geen laptop-project. Voor de meeste ondernemers betekent dit dat je het via een cloudprovider of API-dienst zult afnemen, niet zelf hosten.
De bredere verschuiving
Wat mij het meest opvalt aan dit verhaal is niet het snelheidscijfer op zich, maar het patroon erachter. SGLang — oorspronkelijk een academisch project van UC Berkeley — is inmiddels uitgegroeid tot een commerciële startup (RadixArk) met een waardering van rond de 400 miljoen dollar. Het framework draait op meer dan 400.000 GPU's wereldwijd.
Dat een open-source serving-framework dag-één ondersteuning levert voor het grootste open model, mét goedkeuring van de modelmaker (Kimi Vendor Verifier), mét ondersteuning van NVIDIA, AMD, Google en anderen — dat laat zien hoe volwassen het open AI-ecosysteem aan het worden is.
Voor mij is dit vooral een signaal dat de tijd voorbij is waarin je als ondernemer automatisch bij één of twee grote partijen uitkwam voor AI-capaciteit. De opties worden breder, sneller, en — niet onbelangrijk — goedkoper. De kunst is nu om te bepalen welke optie bij jouw bedrijf past.
80% van de AI-projecten haalt productie nooit.
Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.