TL;DR
- Wat: NVIDIA lanceert open AI-modellen (Nemotron 3 Ultra en 3.5 Lightning) die je lokaal kunt draaien — van een RTX-laptop tot een DGX Station-werkstation.
- Waarom relevant: lokale AI betekent dat bedrijfsdata niet naar een cloudprovider hoeft, wat voor privacy en controle interessant is.
- Wat je ermee kunt: inventariseer of jouw AI-gebruik gebaat is bij lokaal draaien, en welk hardwareniveau daarbij past.
Ik stuitte op een bericht van NVIDIA over het lokaal draaien van hun open Nemotron-modellen op een DGX Station. Wat mij hierin opvalt: een chipfabrikant die actief zegt "draai het zelf, op je eigen kantoor." Dat is een andere boodschap dan "huur rekenkracht in de cloud."
Wat zijn Nemotron 3 Ultra en Nemotron Labs?
Nemotron 3 Ultra is NVIDIA's grootste open model. Het telt 550 miljard parameters, waarvan er 55 miljard tegelijk actief zijn per berekening. Dat klinkt abstract, dus laat ik het even vertalen: het model is opgebouwd als een team van specialisten (een zogeheten mixture-of-experts-architectuur), waarbij per vraag alleen de relevante experts aan het werk gaan. Daardoor is het zuiniger dan je op basis van de totale omvang zou verwachten.
Het model heeft een contextvenster van één miljoen tokens. Dat betekent ruwweg dat het in één keer een document van honderden pagina's kan verwerken — denk aan een compleet jaarverslag of een uitgebreid contractpakket.
Sinds 4 juni 2026 is Nemotron 3 Ultra beschikbaar via Hugging Face en NVIDIA's eigen platform. Op de Artificial Analysis Intelligence Index scoort het een 48, wat het volgens die benchmark het best presterende open model van Amerikaanse makelij maakt. Ter vergelijking: het Chinese Kimi K2.6 scoort daar een 54. Het is dus niet het allerbeste open model ter wereld, maar het speelt mee in de top.
NVIDIA heeft daarnaast de Nemotron Coalition opgericht: een samenwerkingsverband met AI-labs als Mistral AI, Perplexity en Cursor om open modellen gezamenlijk verder te ontwikkelen. Ik vind dat een opvallende zet — NVIDIA positioneert zich hiermee niet alleen als hardwareleverancier, maar als speler in het open-modellenecosysteem.
DGX Station: een AI-werkstation op je bureau
Het idee van lokale AI staat of valt met hardware. NVIDIA's antwoord is de DGX Station for Windows, een werkstation ter grootte van een kleine pc-toren, gebouwd rond de GB300 Grace Blackwell Ultra-chip.
De specificaties zijn indrukwekkend: tot 748 GB coherent geheugen en 20 petaFLOPS aan AI-rekenkracht. In de praktijk betekent dit dat je Nemotron 3 Ultra — met zijn 550 miljard parameters — op één apparaat kunt draaien zonder cloudverbinding.
Beschikbaarheid en prijs
DGX Station-systemen worden geleverd door partners als HP, Dell, ASUS en MSI. De verwachte beschikbaarheid is Q4 2026, met HP die al voor augustus levert. De prijzen liggen tussen de 100.000 en 123.000 dollar.
Ik ga hier eerlijk zijn: dat is geen MKB-budget voor de meeste ondernemers. Dit is hardware voor organisaties die structureel grote hoeveelheden data lokaal willen verwerken — denk aan juridische kantoren met gevoelige dossiers, zorginstellingen, of ingenieursbureaus met propriëtaire ontwerpdata.
De lichtere variant: Nemotron 3.5 Lightning
Wat ik interessanter vind voor de meeste ondernemers is Nemotron 3.5 Lightning. Dit is een veel compacter model: 30 miljard parameters totaal, waarvan er slechts 3 miljard tegelijk actief zijn. Het draait op een gewone RTX-laptop of -desktop.
NVIDIA claimt dat het tot vier keer sneller tokens genereert dan vergelijkbare open modellen, en dat het 30 procent minder tijd nodig heeft om taken af te ronden. Het model is beschikbaar in geoptimaliseerde formaten (NVFP4 en BF16) en werkt met bekende tools als Ollama, llama.cpp en LM Studio.
Stel dat je als ondernemer een AI-assistent wilt voor interne documentatie, klantvragen, of het samenvatten van offertes — en je wilt niet dat die data via een externe API gaat. Dan is een model als Lightning op een bestaande RTX-werkplek een reëel scenario. Geen maandelijks API-abonnement, geen dataverzending naar derden.
Wat heb je nodig?
Voor Nemotron 3.5 Lightning in het compacte NVFP4-formaat heb je een recente NVIDIA RTX-videokaart nodig met voldoende geheugen. Denk aan een RTX 4090 of een RTX PRO-werkstation. Dat is een investering van enkele duizenden euro's — een ander gesprek dan de zes cijfers van een DGX Station.
Wat betekent dit voor je bedrijf?
De trend die ik hier zie is dat het lokaal draaien van AI-modellen steeds haalbaarder wordt — niet alleen technisch, maar ook qua ecosysteem. NVIDIA werkt samen met de populairste open-source tools, levert modellen in standaardformaten, en biedt hardware op meerdere prijsniveaus.
Voor Nederlandse ondernemers zijn er een paar concrete overwegingen:
- Privacy en AVG: als je AI inzet voor klantdata, contracten of personeelsdossiers, dan is lokaal draaien een manier om data binnen je eigen muren te houden. Geen data die via Amerikaanse servers gaat.
- Kosten op langere termijn: API-kosten bij cloud-AI tikken door naarmate je meer gebruikt. Lokale hardware is een eenmalige investering (plus stroom en onderhoud). Bij intensief gebruik kan dat voordeliger uitpakken.
- Controle en beschikbaarheid: een lokaal model werkt ook als je internetverbinding eruit ligt, en je bent niet afhankelijk van prijswijzigingen of beleidsveranderingen van een cloudleverancier.
Tegelijkertijd: lokaal draaien vraagt technische kennis voor installatie en onderhoud. Je hebt iemand nodig die weet hoe je een model configureert, bijwerkt en monitort. Dat is een reële drempel.
Niet alles is rozengeur
Er is ook kritiek. Meerdere bronnen wijzen erop dat NVIDIA's open modellen weliswaar open-weight zijn (je kunt de modelgewichten downloaden), maar dat ze sterk geoptimaliseerd zijn voor NVIDIA's eigen CUDA-platform. In de praktijk betekent dat: je hebt NVIDIA-hardware nodig. Wie een AMD-videokaart heeft, kan hier weinig mee. Dat is geen onbelangrijk detail — het maakt de "openheid" van deze modellen deels voorwaardelijk.
Een stille verschuiving
Voor mij is dit vooral een signaal dat de AI-industrie in twee richtingen beweegt tegelijk. Aan de ene kant worden cloudmodellen steeds krachtiger en toegankelijker. Aan de andere kant wordt lokale AI steeds serieuzer — niet als hobbyproject, maar als zakelijke optie.
Of de DGX Station iets is voor jouw bedrijf? Waarschijnlijk niet op dit prijspunt. Maar een RTX-werkstation met Nemotron 3.5 Lightning erop? Dat begint in de buurt te komen van iets dat een groeiend MKB-bedrijf realistisch kan overwegen. Ik vind het in elk geval opvallend dat de grootste chipmaker ter wereld actief zegt: je hoeft niet naar de cloud. Dat zegt iets over waar de markt naartoe beweegt.
80% van de AI-projecten haalt productie nooit.
Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.