Kimi K3 open weights beschikbaar: wat snelheid met een model doet

Kimi K3 open weights beschikbaar: wat snelheid met een model doet

TL;DR

  • Wat: Moonshot AI heeft de open weights van Kimi K3 vrijgegeven — een AI-model met 2,8 biljoen parameters dat nu door externe partijen 3x sneller wordt geserveerd dan via de maker zelf.
  • Waarom relevant: open weights betekenen dat je als ondernemer niet meer afhankelijk bent van één aanbieder voor prijs, snelheid of dataverwerking.
  • Wat je ermee kunt: als je AI-tools via API's gebruikt, check of jouw provider Kimi K3 aanbiedt — de kosten en snelheid kunnen gunstiger zijn dan wat je nu betaalt.

Ik kwam vandaag een bericht tegen van @bridgemindai dat precies laat zien waarom het vrijgeven van modelgewichten zo'n verschil maakt. Moonshot AI — het Chinese bedrijf achter Kimi K3 — publiceerde de open weights van hun vlaggenschipmodel. Binnen uren serveerde Fireworks AI hetzelfde model drie keer sneller dan Moonshot zelf. Dat vind ik een mooi voorbeeld van hoe concurrentie in AI concreet werkt.

Wat is er precies gebeurd?

Kimi K3 werd op 16 juli 2026 gelanceerd als het grootste open-weight AI-model ooit: 2,8 biljoen parameters, een contextvenster van 1 miljoen tokens, en sterke benchmarkresultaten in onder meer codering en taakautomatisering. Het model draaide aanvankelijk alleen via de eigen servers van Moonshot AI en via hun API.

Het probleem: de snelheid. Gebruikers rapporteerden een wachttijd van zo'n 11 seconden voordat het model überhaupt begon met antwoorden — de zogeheten time-to-first-token. Ter vergelijking: dat is alsof je in een restaurant bestelt en de ober pas na twee minuten bevestigt dat hij je gehoord heeft. Technisch werkt het, maar in de praktijk sluit je het tabblad.

Op 26-27 juli publiceerde Moonshot de volledige modelgewichten op Hugging Face. Dat zijn de bestanden waarmee andere partijen het model zelf kunnen draaien, zonder via Moonshot te hoeven gaan. Fireworks AI — een Amerikaans hostingplatform — had het model dezelfde dag in de lucht: 45 tokens per seconde, 1,44 seconden latentie. Drie keer sneller.

Waarom open weights ertoe doen

De tweet van @bridgemindai vat het kernpunt goed samen: "You release the weights and the entire industry fixes your problems for you. Same day." En dat is precies wat hier gebeurde.

Wat mij opvalt, is dat dit patroon zich steeds vaker herhaalt in de AI-wereld. Een bedrijf bouwt een krachtig model, maar heeft niet de beste infrastructuur om het razendsnel te serveren. Door de weights vrij te geven, kunnen gespecialiseerde hostingpartijen — met geoptimaliseerde hardware en software — dat model sneller en goedkoper aanbieden.

Voor een ondernemer is de analogie simpel: stel dat je een uitstekend product maakt, maar je eigen webshop is traag. Op het moment dat je je product via bol.com of Amazon aanbiedt, heb je ineens hun logistiek en snelheid tot je beschikking. Open weights werken vergelijkbaar — je geeft het model vrij, en de markt optimaliseert de levering.

Wat zijn open weights precies?

Even voor de helderheid: open weights betekent dat het bedrijf de technische bestanden publiceert waarmee het model draait. Andere partijen kunnen het model dan downloaden, aanpassen en zelf hosten. Het is niet hetzelfde als volledig open source — de trainingsdata en exacte trainingsprocedure worden meestal niet gedeeld — maar het geeft wel veel meer vrijheid dan een API waar je als gebruiker blind op vertrouwt.

De prestaties: waar staat Kimi K3?

Volgens de beschikbare benchmarks scoort Kimi K3 op de derde plaats op de Artificial Analysis-ranglijst, achter Claude Fable 5 en GPT-5.6 Sol. In vier van de acht taakautomatisering-benchmarks eindigde het als eerste. Op het gebied van frontend-codering — beoordeeld in een blinde arena — gaven ontwikkelaars de voorkeur aan K3 boven de twee Amerikaanse concurrenten.

Ik vind het eerlijk gezegd opvallend dat een model uit China in bepaalde categorieën de modellen van Anthropic en OpenAI verslaat. Dat zegt iets over hoe snel de voorsprong in AI verschuift.

Enkele concrete cijfers die Moonshot rapporteert:

  • 93,5% op GPQA Diamond (een kennisbenchmark) — het hoogste open-weight resultaat ooit op die test
  • 67,5 op DeepSWE (software engineering)
  • Eerste plek op Frontend Code Arena met 1.679 Elo, boven Claude Fable 5 (1.631)

Een kanttekening: dit zijn deels door Moonshot zelf gerapporteerde resultaten. Onafhankelijke verificatie via ranglijsten als BenchLM plaatst K3 op de vijfde plek van 215 modellen, wat nog steeds sterk is maar iets genuanceerder dan de eigen communicatie.

Wat betekent dit voor een ondernemer?

Kun je als MKB-eigenaar dit model zelf draaien? Eerlijk gezegd: waarschijnlijk niet. De modelbestanden zijn zo'n 1,4 terabyte groot (in het gecomprimeerde MXFP4-formaat). Moonshot adviseert minimaal 64 GPU-acceleratoren — denk aan acht servers met elk acht high-end chips. Dat is infrastructuur van honderdduizenden euro's.

Maar dat is niet waar de relevantie zit. De relevantie zit in wat er om het model heen gebeurt:

  • Prijsconcurrentie. Nu meerdere partijen K3 kunnen hosten, ontstaat er concurrentie op prijs. De API-kosten via Moonshot zijn $3 per miljoen input-tokens en $15 per miljoen output-tokens. Hostingpartijen als Fireworks en Together AI kunnen daar onder gaan zitten.
  • Snelheid. Een model dat 11 seconden denktijd nodig heeft voordat het antwoordt, is onbruikbaar voor klantgerichte toepassingen. Bij 1,4 seconden wordt het ineens interessant voor chatbots, klantenservice-automatisering of documentsamenvatting.
  • Dataprivacy. Wie het model zelf host — of laat hosten bij een Europese provider — stuurt geen data naar Chinese servers. Dat is relevant voor bedrijven in gereguleerde sectoren of met gevoelige klantgegevens.

Stel dat je als ondernemer een AI-tool gebruikt voor het analyseren van offertes of het samenvatten van klantgesprekken. Het verschil tussen 11 seconden en 1,4 seconden wachttijd is het verschil tussen een tool die je medewerkers daadwerkelijk gebruiken en eentje die ze negeren.

Een breder patroon

Wat ik hier vooral interessant vind, is het bredere plaatje. We zien steeds vaker dat de waarde van een AI-model niet alleen in het model zelf zit, maar in het ecosysteem eromheen. Wie de weights vrijgeeft, krijgt gratis optimalisatie van de hele industrie. Wie ze achter slot en grendel houdt, moet alles zelf oplossen.

Dat is geen abstract verhaal. Voor ondernemers die AI-tools evalueren, betekent het concreet: kijk niet alleen naar welk model het slimste is, maar ook naar welk model het breedst beschikbaar is. Een breed beschikbaar model heeft meer aanbieders, meer concurrentie op prijs, en meer kans dat iemand het optimaliseert voor jouw specifieke toepassing.

Voor mij is dit vooral een signaal dat de AI-markt volwassener wordt. Het gaat niet meer alleen om wie het grootste model bouwt, maar om wie het het snelst, goedkoopst en veiligst bij de eindgebruiker krijgt. En dat is uiteindelijk goed nieuws voor iedereen die AI wil inzetten zonder zelf een datacenter te hoeven bouwen.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.