TL;DR
- Wat: NVIDIA brengt Nemotron 3.5 Lightning uit — een open-source AI-model met 31,6 miljard parameters, 1 miljoen tokens context en een doorvoersnelheid van circa 670 tokens per seconde.
- Waarom relevant: Het model is gratis te gebruiken, aan te passen en te verspreiden onder een open licentie, wat de drempel voor AI-inzet bij MKB-bedrijven flink verlaagt.
- Wat je ermee kunt: Bekijk of je huidige AI-kosten omlaag kunnen door een gratis, zelf te hosten model te overwegen — bijvoorbeeld voor het verwerken van lange documenten of geautomatiseerde code-reviews.
Ik viel vanochtend over een bericht van OpenCode: NVIDIA's Nemotron 3.5 Lightning is nu gratis beschikbaar op hun platform. Een AI-model met een contextvenster van een miljoen tokens, volledig open-source, en snel genoeg om op één enkele GPU te draaien. Dat trok mijn aandacht, want dit soort combinaties zie je niet elke dag.
Wat is Nemotron 3.5 Lightning precies?
Nemotron 3.5 Lightning is het nieuwste open-source model uit NVIDIA's Nemotron-familie. Het is een zogeheten Mixture-of-Experts-model (MoE) — een architectuur waarbij het model in totaal 31,6 miljard parameters heeft, maar er op elk moment slechts 3,6 miljard actief zijn. Vergelijk het met een groot kantoor waar honderd specialisten werken, maar per vraag alleen de drie of vier relevante experts aan tafel schuiven. Dat maakt het model veel sneller en zuiniger dan je op basis van het totale parametertal zou verwachten.
Het model gebruikt een hybride Mamba-Transformer-architectuur en ondersteunt een contextvenster van één miljoen tokens. In begrijpelijke termen: je kunt er documenten van honderden pagina's in één keer doorheen halen. Denk aan jaarverslagen, contractpakketten of uitgebreide codebases.
NVIDIA levert het model onder de OpenMDW-1.1-licentie. Dat betekent dat bedrijven het mogen downloaden, gebruiken, aanpassen én herverdelen — zonder toestemming te vragen en zonder te betalen.
Snelheid als onderscheidende factor
Wat mij hier opvalt is de nadruk op snelheid boven ruwe intelligentie. Volgens benchmarks van The Decoder haalt Nemotron 3.5 Lightning ongeveer 670 tokens per seconde. Dat is volgens de beschikbare vergelijkingen bijna twee keer zo snel als Google's Gemini 3.5 Flash-Lite.
Om dat wat tastbaarder te maken: een complexe taak die bij vergelijkbare modellen zo'n 3,5 minuut duurt, zou Lightning in ongeveer 30 seconden afhandelen. Voor een ondernemer die AI inzet voor terugkerende taken — stel dat je dagelijks tientallen documenten laat samenvatten of classificeren — scheelt dat niet alleen tijd, maar ook rekenkosten.
Op de Artificial Analysis Intelligence Index scoort het model een 24, wat volgens de beschikbare data gelijkstaat aan OpenAI's gpt-oss-120b. Het bijzondere: dat model is vier keer zo groot. Lightning matcht die score dus met een kwart van de parameters. Op agentische benchmarks (GDPval-AA v2) scoort het zelfs hoger, met een Elo-rating van 824 tegenover 800 voor gpt-oss-120b.
Ik vind het eerlijk gezegd opvallend dat NVIDIA hier niet de grootste of slimste claimt, maar de snelste. Dat zegt iets over waar de markt naartoe beweegt.
Waarom is dit relevant voor een ondernemer?
Laat ik beginnen met wat dit níét is: dit is geen kant-en-klare bedrijfsoplossing die je morgen installeert en die je administratie overneemt. Het is een bouwsteen — een AI-model dat je (of je technische partner) kunt inzetten als onderdeel van een groter systeem.
Maar de drempelverlaging is wel degelijk interessant. Er zijn drie dingen die opvallen:
Geen licentiekosten
De OpenMDW-1.1-licentie maakt commercieel gebruik expliciet mogelijk zonder kosten. Voor MKB-bedrijven die nu maandelijks betalen voor API-toegang tot modellen van OpenAI of Anthropic, is dit een overweging waard. De kosten verschuiven van een API-abonnement naar het draaien van hardware — en dat kan bij een licht model als dit al op een enkele krachtige GPU.
Lange context voor documentverwerking
Een miljoen tokens context is veel. Ter vergelijking: een gemiddeld boek bevat zo'n 70.000 tot 100.000 woorden, oftewel ruwweg 100.000 tot 130.000 tokens. Je kunt dit model dus meerdere boeken tegelijk laten verwerken. Stel dat je als ondernemer in de juridische dienstverlening zit en regelmatig grote contractpakketten moet doornemen — een model met dit contextvenster kan in theorie het hele pakket in één keer analyseren.
Geschikt voor geautomatiseerde workflows
NVIDIA positioneert Lightning nadrukkelijk als een model voor agent-gebaseerde systemen. Dat zijn opstellingen waarbij AI-modellen zelfstandig taken uitvoeren in een keten: een stuk code reviewen, een rapport samenvatten, een classificatie maken. De snelheid van het model maakt het volgens NVIDIA bijzonder geschikt voor dit soort ketens, waar elke vertraging zich vermenigvuldigt.
Beschikbaarheid via OpenCode
Het model is nu gratis beschikbaar via OpenCode, een open-source AI-codeeragent die in de terminal draait. OpenCode ondersteunt meerdere AI-providers — waaronder OpenAI, Anthropic, Google en nu dus NVIDIA — en laat ontwikkelaars direct vanuit hun werkomgeving met modellen werken.
Voor niet-technische ondernemers is OpenCode misschien niet het eerste aanspreekpunt. Maar het signaal is breder: NVIDIA maakt zijn snelste model beschikbaar via een groeiend ecosysteem van gratis tools. Het model is ook te vinden op platforms als Hugging Face en Ollama, wat de toegankelijkheid verder vergroot.
Wat ik wel wil benoemen: "gratis" betekent hier dat je geen licentie- of API-kosten betaalt aan NVIDIA. Je hebt nog steeds hardware nodig om het model te draaien, of je gebruikt een hostingpartij. De NVFP4-variant (een gecomprimeerde versie) is specifiek geoptimaliseerd om op minder krachtige hardware te draaien, maar een standaard kantoorlaptop zal niet volstaan.
Kanttekeningen
Een paar dingen om in het achterhoofd te houden. Het model is text-only — geen beeld, geen audio. Voor toepassingen die multimodale input vereisen, heb je een ander model nodig.
Daarnaast is "open-source" niet hetzelfde als "eenvoudig in gebruik". Het draaien van een model met 31,6 miljard parameters vereist technische kennis en passende hardware. Voor veel MKB-bedrijven betekent dit dat je een technische partner of dienstverlener nodig hebt.
En hoewel de benchmarkresultaten indrukwekkend zijn, is het goed om te weten dat benchmarks niet altijd één-op-één vertalen naar prestaties in de praktijk. Ik zou zelf willen zien hoe het model presteert op specifiek Nederlandse taken — de meeste benchmarks zijn Engelstalig.
Een markt die verschuift naar snelheid en openheid
Voor mij is dit vooral een signaal dat de AI-markt in een nieuwe fase zit. De race om het slimste model lijkt plaats te maken voor een race om het snelste, zuinigste en meest toegankelijke model. NVIDIA kiest er bewust voor om dit model volledig open en gratis aan te bieden — vermoedelijk omdat ze meer verdienen aan de GPU's waarop het draait dan aan licenties voor het model zelf.
Kun je je voorstellen wat dit betekent als deze trend doorzet? De modellen worden gratis, de tools worden gratis, en de kosten zitten straks alleen nog in de rekenkracht en de expertise om het goed in te zetten. Wat mij betreft verschuift de waarde daarmee steeds meer naar het slim toepassen van AI — en dat is precies waar ondernemers het verschil kunnen maken.
80% van de AI-projecten haalt productie nooit.
Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.