Kimi K3 nu beschikbaar via Nebius Token Factory

Kimi K3 nu beschikbaar via Nebius Token Factory

TL;DR

  • Wat: Het Chinese AI-model Kimi K3 (2,8 biljoen parameters, open weights) is vanaf dag één beschikbaar via het inferenceplatform Nebius Token Factory.
  • Waarom relevant: Een krachtig open model dat je via een simpele API-call kunt aanroepen, verlaagt de drempel om AI in je bedrijfsprocessen te testen.
  • Wat je ermee kunt: Evalueer of K3 via Nebius Token Factory een geschikt en betaalbaar alternatief is voor je huidige AI-provider.

Ik stuitte op een bericht van Demian (Nebius) waarin hij beschreef hoe teams het hele weekend doorwerkten om Kimi K3 als "Day 0 partner" live te krijgen op hun platform. Het resultaat klinkt simpel — model kiezen, API aanroepen — maar de moeite die erin ging, zegt iets over hoe serieus de strijd om inferenceplatformen nu wordt. Dat vind ik het vastleggen waard.

Wat is Kimi K3 precies?

Kimi K3 is het nieuwste AI-model van Moonshot AI, een Chinees bedrijf dat in korte tijd naam heeft gemaakt in de AI-wereld. Het model telt 2,8 biljoen parameters. Om dat in perspectief te plaatsen: dat is naar verluidt het grootste open-weight model dat tot nu toe is uitgebracht.

Nu klinkt "2,8 biljoen parameters" als een onbegrijpelijk getal, en dat is het eerlijk gezegd ook. Maar het bijzondere is dat K3 werkt met een zogenaamde Mixture of Experts-architectuur. Dat betekent dat bij elke berekening slechts 16 van de 896 beschikbare "experts" actief zijn. Vergelijk het met een groot kantoor waar 896 specialisten zitten, maar je per vraag alleen de 16 juiste mensen aan het werk zet. Het gevolg: de rekenkracht die je nodig hebt (en dus de kosten) zijn veel lager dan dat gigantische parametergetal doet vermoeden.

Verder biedt K3 een contextvenster van één miljoen tokens. Dat komt ruwweg neer op honderdduizenden woorden die je in één keer kunt meegeven — denk aan complete handleidingen, contracten of jaarverslagen.

Hoe presteert het model?

Ik vind het interessant om naar de benchmarks te kijken, omdat die een aardig beeld geven van waar K3 staat ten opzichte van de concurrentie.

Volgens Artificial Analysis scoort K3 een 57,11 op hun Intelligence Index. Daarmee staat het op plek vier, achter Claude Fable 5 (59,86) en twee varianten van GPT-5.6 Sol. Het is dus niet het allerbeste model op de markt — dat claimt Moonshot zelf ook niet — maar het zit er dicht tegenaan.

Waar K3 wél bovenaan staat, is in de Frontend Code Arena van LMArena. Daar haalde het de eerste plek met een Elo-score van 1.679 en won het in 76% van de directe vergelijkingen van Claude Fable 5. Voor bedrijven die AI inzetten voor softwareontwikkeling of webapplicaties is dat een opvallend gegeven.

Qua snelheid genereert K3 zo'n 62 tokens per seconde, met een reactietijd van ongeveer twee seconden. Dat is snel genoeg voor de meeste zakelijke toepassingen.

Wat is Nebius Token Factory?

Nebius Token Factory is een managed inferenceplatform. Dat klinkt technisch, maar het komt erop neer dat je als gebruiker geen eigen servers hoeft op te tuigen om een AI-model te draaien. Je kiest een model, roept de API aan, en Nebius regelt de rest: schaalbaarheid, uptime, snelheid.

Het platform biedt toegang tot meer dan zestig open modellen, waaronder DeepSeek, Llama en Qwen. De API is compatibel met de OpenAI-standaard, wat betekent dat je bestaande code vaak zonder grote aanpassingen kunt hergebruiken. Voor een ondernemer die al met de OpenAI API werkt, is de overstap technisch gezien relatief klein.

Wat mij opvalt aan het bericht van Demian is de nadruk op het partnerschap. Nebius was een "Day 0 partner" — ze hadden K3 beschikbaar op de dag van lancering. In de wereld van inferenceplatformen is dat een concurrentievoordeel: wie het nieuwste model het snelst aanbiedt, trekt ontwikkelaars en bedrijven aan.

Wat kost het?

De prijzen van K3 via Moonshots eigen API liggen op $3 per miljoen input-tokens en $15 per miljoen output-tokens. Bij herhaald gebruik van dezelfde context (denk aan een vast systeemprompt of steeds dezelfde documentatie) zakt de inputprijs naar $0,30 per miljoen tokens dankzij caching.

Om dat tastbaar te maken: stel dat je als ondernemer dagelijks een samenvatting laat maken van tien pagina's aan notities. Dan praat je over enkele centen per keer. Voor grotere toepassingen — bijvoorbeeld het analyseren van honderden klantreviews of het genereren van productbeschrijvingen — lopen de kosten op, maar blijven ze aanzienlijk lager dan bij veel gesloten modellen van vergelijkbare kwaliteit.

Een kanttekening bij de kosten

K3 draait altijd op maximale "reasoning effort". Er is geen goedkopere, snellere modus beschikbaar. Elk output-token, inclusief de interne redeneerstappen, kost $15 per miljoen. Voor simpele taken waar je geen diep redeneren nodig hebt, kan een lichter model voordeliger zijn.

Wat betekent dit voor ondernemers?

Ik denk dat er drie dingen zijn die dit relevant maken voor MKB-eigenaren.

Meer keuze, lagere drempel

Open-weight modellen zoals K3 verlagen de afhankelijkheid van één leverancier. Je kunt het model via Nebius aanroepen, maar in principe ook zelf hosten als je dat wilt. Die keuzevrijheid is voor bedrijven die nadenken over leveranciersrisico een serieuze overweging.

Let op privacy en compliance

K3 komt van een Chinees bedrijf. Voor Nederlandse ondernemers die werken met persoonsgegevens of gevoelige bedrijfsdata is het verstandig om goed te kijken naar waar je data naartoe gaat. Gebruik je het model via een Europees platform als Nebius, dan is de situatie anders dan wanneer je rechtstreeks de Chinese API aanspreekt. Maar ook dan: controleer de verwerkersovereenkomst, vraag naar dataretentie, en maak een bewuste keuze.

De inferencestrijd raakt jou indirect

Kun je je voorstellen dat je als ondernemer binnenkort AI-modellen kiest zoals je nu een cloudprovider kiest? Dat is de richting waarin het gaat. Platforms als Nebius Token Factory maken het steeds makkelijker om te wisselen tussen modellen. De concurrentie tussen die platforms drukt de prijzen en verbetert de service. Daar profiteer je uiteindelijk van, ook als je nu nog niet actief met AI-API's werkt.

Wat mij bijblijft

Voor mij is dit vooral een signaal dat de markt voor AI-modellen volwassener wordt. Het gaat niet meer alleen om wie het beste model heeft, maar ook om wie dat model het snelst, betrouwbaarst en goedkoopst bij de eindgebruiker krijgt. Dat een team een heel weekend doorwerkt om een nieuw model op dag één beschikbaar te hebben, zegt iets over hoe competitief die laag is geworden. En die competitie — niet het model zelf — is misschien wel het interessantste deel van dit verhaal.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.