Nvidia's Nemotron 3.5 Lightning draait op één GPU

TL;DR

  • Wat: Nvidia bracht Nemotron 3.5 Lightning uit, een open-source AI-model met 30 miljard parameters dat op één enkele GPU kan draaien.
  • Waarom relevant: Een krachtig AI-model dat je lokaal kunt draaien — zonder cloudabonnement — maakt AI-toepassingen bereikbaarder voor kleinere bedrijven.
  • Wat je ermee kunt: Inventariseer of jouw bedrijf taken heeft (klantvragen, code-reviews, monitoring) die baat hebben bij een lokaal draaiend AI-model, en download het gratis via Hugging Face om te testen.

Nvidia heeft op 11 augustus 2026 een nieuw open-source AI-model uitgebracht: Nemotron 3.5 Lightning. Wat mij opviel toen ik het bericht zag: dit model is specifiek ontworpen om op één GPU te draaien — ook op een krachtige desktop-pc. Ik vind dat interessant genoeg om er even bij stil te staan, want dit soort ontwikkelingen bepalen straks hoe toegankelijk AI écht wordt voor ondernemers.

Wat is Nemotron 3.5 Lightning precies?

Nemotron 3.5 Lightning is een taalmodel van Nvidia met in totaal zo'n 30 miljard parameters, maar — en dit is het slimme deel — het activeert er slechts 3 miljard per keer. Het model gebruikt een architectuur die mixture-of-experts heet. Stel je een bedrijf voor met dertig specialisten, maar voor elke klantvraag zet je er maar drie in: precies degenen die het meest relevant zijn. De rest zit klaar, maar verbruikt geen energie. Dat is in essentie wat dit model doet.

Door die aanpak past het in het geheugen van één GPU — zelfs op Nvidia's eigen RTX-pc's, DGX Spark-systemen en vergelijkbare hardware. Je hebt geen datacenter nodig. Nvidia claimt dat het model tot vier keer sneller output levert dan vergelijkbare open modellen, wat leidt tot zo'n 30 procent snellere afronding van taken.

Het model ondersteunt een contextvenster van één miljoen tokens. Ter vergelijking: dat is genoeg om een flink boek in één keer te verwerken. Het is getraind op meer dan 20 biljoen tokens aan data en scoort volgens de onafhankelijke benchmarksite Artificial Analysis een Intelligence Index van 24 — negen punten hoger dan zijn voorganger.

Waarom "open-source" hier ertoe doet

Nvidia publiceert de modelgewichten onder een permissieve licentie (OpenMDW-1.1). Dat betekent: je mag het model gratis downloaden, aanpassen en commercieel gebruiken. Er is geen toestemming nodig en je betaalt geen licentiekosten. Het is beschikbaar via Hugging Face, Ollama, OpenRouter en Nvidia's eigen Build-platform.

Wat mij hier opvalt, is dat Nvidia — een bedrijf dat primair geld verdient met hardware — er belang bij heeft om krachtige software gratis weg te geven. Hoe meer mensen AI lokaal draaien, hoe meer GPU's er verkocht worden. Dat is geen geheim, maar het resultaat is wel dat ondernemers er direct van profiteren: je krijgt een model van hoog niveau zonder maandelijkse abonnementskosten.

Nvidia publiceert bovendien de trainingsdata en -technieken, zodat organisaties het model kunnen auditeren en reproduceren. Ik vind dat een verstandige zet. Voor bedrijven die zich zorgen maken over transparantie en traceerbaarheid — denk aan sectoren met strenge compliance-eisen — is dat een relevant detail.

Wat kun je ermee als ondernemer?

Het model is gebouwd voor wat Nvidia agentic AI noemt: AI-systemen die zelfstandig taken uitvoeren, stap voor stap, zonder dat je ze continu aanstuurt. Denk aan een digitale medewerker die binnenkomende e-mails classificeert, klantenvragen beantwoordt, of code controleert.

Nvidia noemt concreet deze toepassingen:

  • Code-review: het model kan code beoordelen en suggesties doen
  • Beveiligingsmonitoring: alerts analyseren en prioriteren
  • Klantenservice: factuurvragen of standaardverzoeken afhandelen

Bedrijven als CrowdStrike (cybersecurity), Harvey (juridische dienstverlening) en CodeRabbit (code-review) hebben het model al aangepast voor hun eigen vakgebied.

Kun je je voorstellen wat dit betekent als je een bedrijf hebt met een druk supportteam? Stel dat je als ondernemer dagelijks tientallen standaardvragen binnenkrijgt over levertijden, retourbeleid of factuurgegevens. Een model als dit zou — mits goed ingericht — een deel van die stroom kunnen filteren en beantwoorden, zonder dat je data naar een externe cloud stuurt.

Lokaal draaien: privacy als bijvangst

Dat lokale aspect verdient extra aandacht. Wanneer je een AI-model op je eigen hardware draait, verlaten je gegevens je netwerk niet. Voor ondernemers die werken met klantdata, personeelsinformatie of bedrijfsgevoelige documenten is dat een relevant voordeel. Je bent niet afhankelijk van de privacyvoorwaarden van een cloudprovider.

Dat gezegd hebbend: "op één GPU draaien" klinkt laagdrempelig, maar je hebt wel een behoorlijk krachtige GPU nodig. Een standaard kantoor-pc met geïntegreerde grafische kaart volstaat niet. Denk eerder aan een machine met een recente Nvidia RTX-kaart met voldoende geheugen. Dat is een investering, maar het is een ander kostenplaatje dan een cloudabonnement dat maandelijks doorloopt.

Hoe verhoudt het zich tot de concurrentie?

De AI-modellenmarkt is druk. Meta heeft Llama, Google heeft Gemma, en er zijn talloze andere open modellen. Wat Nemotron 3.5 Lightning onderscheidt, is de combinatie van snelheid en efficiëntie. Volgens Artificial Analysis genereert het model bijna 670 tokens per seconde — daarmee is het een van de snelste in zijn klasse.

Op agentic benchmarks — tests die meten hoe goed een model zelfstandig complexe taken uitvoert — scoort Lightning een Elo-rating van 824. Dat is hoger dan zowel gpt-oss-120b als Nvidia's eigen grotere model, Nemotron 3 Super. Op SWE-bench Verified, een benchmark voor softwareontwikkeling, ging de score van 34 naar 52 ten opzichte van de voorganger.

Ik denk dat het eerlijk is om te zeggen dat dit model niet de slimste is op de markt — Nvidia zelf positioneert het als snel en efficiënt, niet als het meest intelligente. The Decoder, een gespecialiseerd AI-medium, vatte het treffend samen: Nvidia kiest hier bewust voor snelheid boven maximale intelligentie. Voor veel zakelijke toepassingen is dat precies de juiste afweging. Je wilt niet het briljantste antwoord over twintig seconden — je wilt een goed antwoord, nu.

Wat betekent dit voor de bredere markt?

Wat ik interessant vind aan deze release, is het signaal dat erachter zit. Nvidia — het bedrijf dat de chips maakt waar de hele AI-industrie op draait — investeert stevig in open modellen die juist minder rekenkracht nodig hebben. Dat lijkt tegenstrijdig, maar het is het niet: hoe toegankelijker AI wordt, hoe meer bedrijven ermee aan de slag gaan, en hoe meer hardware er uiteindelijk verkocht wordt.

Voor Nederlandse ondernemers betekent dit concreet dat de drempel om AI in te zetten opnieuw lager wordt. Je hoeft geen contract met een grote cloudpartij af te sluiten. Je hoeft geen AI-team in dienst te hebben. Je kunt een model downloaden, het op een krachtige werkplek draaien, en testen of het waarde toevoegt aan je proces.

Dat is nog niet hetzelfde als plug-and-play — er komt technische kennis bij kijken om het model in te richten en te koppelen aan je systemen. Maar het feit dat de software gratis en open is, verlaagt de instapkosten aanzienlijk.

Voor mij is dit vooral een bevestiging van een trend die ik al langer volg: AI verschuift van iets dat alleen grote techbedrijven konden inzetten, naar iets dat steeds dichter bij de werkvloer van het MKB komt. Niet morgen, maar de richting is helder.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.