NVIDIA's Nemotron-familie groeit: wat open AI-modellen betekenen voor jouw bedrijf

TL;DR

  • Wat: NVIDIA breidt de Nemotron-familie van open AI-modellen uit met nieuwe varianten — van het compacte Nemotron 3.5 Lightning tot het aangekondigde Nemotron 4 met meer dan een biljoen parameters.
  • Waarom relevant: Deze modellen zijn gratis te gebruiken, aan te passen en commercieel in te zetten — ook op bescheiden hardware.
  • Wat je ermee kunt: Inventariseer of je bedrijfsprocessen hebt (klantvragen, documenten, code) waar een open AI-model goedkoper en flexibeler kan zijn dan een abonnement op een gesloten dienst.

Ik stuitte op een bericht van NVIDIA AI over de Nemotron-familie — een reeks open AI-modellen die het afgelopen jaar in rap tempo is gegroeid. Wat mij triggerde: dit zijn modellen die je als ondernemer vrij mag gebruiken, aanpassen en commercieel inzetten. Dat is een ander verhaal dan betalen per API-call bij OpenAI of Google.

Wat is Nemotron eigenlijk?

Nemotron is de naam die NVIDIA geeft aan een familie van AI-taalmodellen. Denk aan modellen vergelijkbaar met ChatGPT of Claude, maar dan met open gewichten — je kunt ze downloaden, op je eigen server draaien en naar wens aanpassen. NVIDIA biedt ze aan onder een permissieve licentie (OpenMDW-1.1), wat betekent dat je er commercieel mee aan de slag kunt zonder toestemming te vragen.

De familie bestaat inmiddels uit meerdere formaten:

  • Nemotron 3 Nano — 31,6 miljard parameters, waarvan 3,6 miljard actief per bewerking. Verscheen in december 2025.
  • Nemotron 3 Super — 120 miljard parameters, gelanceerd op GTC in maart 2026.
  • Nemotron 3 Ultra — 550 miljard parameters, aangekondigd op Computex in juni 2026. Volgens NVIDIA levert dit model "frontier-level intelligence" met vijf keer de doorvoerefficiëntie op Blackwell-hardware.
  • Nemotron 3.5 Lightning — de nieuwste toevoeging, uitgebracht op 11 augustus 2026. Een compact model van 30 miljard parameters waarvan slechts 3 miljard tegelijk actief zijn.

En dan is er nog Nemotron 4, dat in ontwikkeling is en naar verluidt meer dan een biljoen parameters zal tellen. Dat zou het ruwweg twee keer zo groot maken als Nemotron 3 Ultra. Een lanceerdatum is er nog niet; bronnen spreken over "mogelijk in het najaar".

Waarom die verschillende formaten ertoe doen

Ik vind het eerlijk gezegd slim hoe NVIDIA dit opbouwt. De meeste ondernemers denken bij AI aan één groot model — iets als ChatGPT. Maar in de praktijk heb je niet altijd het grootste model nodig. Als je bijvoorbeeld binnenkomende klantvragen wilt categoriseren, is een compact model als Nemotron 3.5 Lightning waarschijnlijk meer dan voldoende. Wil je complexe code laten genereren of uitgebreide documenten analyseren, dan heb je misschien de Ultra-variant nodig.

Het idee achter de verschillende formaten is: gebruik het kleinste model dat je taak aankan. Kleiner model betekent minder rekenkracht, minder energieverbruik en lagere kosten. Wat mij opvalt is dat NVIDIA daar ook tooling voor bouwt — ze hebben recent NeMo Switchyard uitgebracht, een open-source router die automatisch bepaalt welk model het beste past bij een specifieke vraag. Stel dat je als ondernemer een AI-assistent hebt die zowel simpele FAQ-vragen als complexe contractanalyses moet afhandelen. Zo'n router stuurt de simpele vragen naar het kleine model en de complexe naar het grote.

Nemotron 3.5 Lightning: compact maar krachtig

De meest recente release verdient wat extra aandacht, omdat die juist voor kleinere bedrijven interessant kan zijn. Nemotron 3.5 Lightning is een zogeheten Mixture-of-Experts model (MoE). Dat klinkt technisch, maar het principe is goed te vergelijken met een bedrijf waar niet iedereen tegelijk werkt: er zijn 30 miljard parameters beschikbaar, maar per vraag zijn er maar 3 miljard actief. Dat maakt het model snel en relatief goedkoop om te draaien.

Volgens NVIDIA kun je dit model op een enkele moderne GPU draaien — bijvoorbeeld op een DGX Spark of een H100-kaart. Dat zet het binnen bereik van kleinere teams. Je hoeft geen datacenter te huren. Wie liever niet zelf hardware beheert, kan het model ook afnemen via clouddiensten als Baseten, Together AI of Nebius, of via Amazon SageMaker.

Het model is gedistilleerd uit het grotere Nemotron 3 Ultra, wat betekent dat het de kennis van het grote model heeft meegekregen in een compacter jasje. NVIDIA claimt dat het tot vier keer sneller output levert dan vergelijkbare modellen.

Waarvoor kun je het gebruiken?

De toepassingen die NVIDIA noemt zijn breed: klantenservice-automatisering, contractanalyse, code-review, documentverwerking, cybersecurity-triage. Bedrijven als CrowdStrike, ServiceNow en CodeRabbit zetten Nemotron-modellen al in. Maar ook voor een MKB-ondernemer zijn er denkbare scenario's. Stel dat je een webshop hebt met duizenden productpagina's en je wilt automatisch beschrijvingen genereren of klantvragen beantwoorden op basis van je productcatalogus. Een open model als Lightning kun je trainen op jouw eigen data, zonder dat die data naar een externe partij gaat.

Wat betekent "open" hier precies?

Dit is een punt waar ik even bij stil wil staan, want "open" kan veel dingen betekenen. Bij Nemotron 3.5 Lightning publiceert NVIDIA de modelgewichten, trainingsdata én trainingsrecepten onder de OpenMDW-1.1-licentie. Dat is behoorlijk transparant. Je mag het model downloaden, aanpassen en commercieel gebruiken zonder licentiekosten.

Ter vergelijking: bij modellen van OpenAI of Anthropic (het bedrijf achter Claude) betaal je per API-aanroep en heb je geen toegang tot de modelgewichten. Je kunt ze niet op je eigen server draaien of aanpassen. Bij Meta's Llama-modellen heb je wel open gewichten, maar de licentievoorwaarden zijn anders.

Voor een ondernemer is het verschil relevant. Een open model geeft je controle over je data — die verlaat je eigen omgeving niet. Het geeft je ook voorspelbare kosten: je betaalt voor hardware of cloudcapaciteit, niet per verwerkte token. Aan de andere kant vraagt het meer technische kennis om te beheren dan simpelweg een API-sleutel invoeren.

De Nemotron Coalition: samenwerking voor betere basismodellen

Een ontwikkeling die ik interessant vind is de Nemotron Coalition die NVIDIA op GTC aankondigde. Dit is een samenwerkingsverband van AI-labs die gezamenlijk basismodellen bouwen. NVIDIA levert de trainingsinfrastructuur via DGX Cloud, de deelnemende labs brengen expertise en data in. Het idee is dat je zo betere modellen krijgt dan wanneer elk lab in zijn eentje werkt.

Wat mij hier opvalt: NVIDIA positioneert zich niet alleen als chipmaker, maar als het platform waarop de AI-gemeenschap bouwt. Ze verkopen de picks and shovels — de GPU's — maar ook de modellen die erop draaien. Dat is een strategische keuze die gevolgen heeft voor de hele markt.

Voor ondernemers in landen als Nederland is er nog een bijzonder aspect: meerdere organisaties, waaronder AI Singapore en Viettel, gebruiken Nemotron als basis voor gelokaliseerde modellen in hun eigen taal. Ik zou willen weten of er vergelijkbare initiatieven zijn voor het Nederlands — een solide Nederlandstalig open model zou voor veel MKB-bedrijven het verschil kunnen maken.

Een kanttekening

Het is goed om te benoemen dat Nemotron 3 Ultra volgens sommige onafhankelijke analyses niet op alle benchmarks de absolute top haalt vergeleken met concurrenten als GPT-4o of Claude. Dat hoeft geen probleem te zijn — voor veel bedrijfstoepassingen is "goed genoeg" precies goed genoeg, zeker als het alternatief gratis en aanpasbaar is. Maar het is eerlijk om te zeggen dat "open" niet automatisch "best presterend" betekent.

Waar het op neerkomt

Voor mij is dit vooral een signaal dat de AI-markt volwassener wordt. Er is niet meer één model dat alles doet. Er ontstaat een landschap van modellen in verschillende formaten, voor verschillende taken, met verschillende kostenstructuren. Als ondernemer hoef je niet per se het nieuwste en grootste te kiezen — soms is het slimste wat je kunt doen het kleinste model pakken dat je probleem oplost. Dat NVIDIA die keuze nu gratis en open aanbiedt, vind ik een ontwikkeling die de moeite waard is om in de gaten te houden.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.