NVIDIA lanceert Nemotron 3.5 Lightning en NeMo Switchyard

TL;DR

  • Wat: NVIDIA brengt Nemotron 3.5 Lightning uit, een open AI-model dat slechts 3 van zijn 30 miljard parameters activeert per stap, plus NeMo Switchyard — een routeringsbibliotheek die taken automatisch naar het juiste model stuurt.
  • Waarom relevant: Bedrijven die AI-agents inzetten, kunnen hiermee hun kosten met 60-70% verlagen zonder veel in te leveren op kwaliteit.
  • Wat je ermee kunt: Inventariseer welke AI-taken in jouw bedrijf een zwaar model vereisen en welke niet — dat onderscheid wordt nu concreet te benutten.

Ik viel gisteren over een aankondiging van NVIDIA die op het eerste gezicht technisch klinkt, maar bij nadere inspectie behoorlijk praktisch is voor ondernemers die met AI werken. Het bedrijf bracht twee producten uit: een nieuw open AI-model genaamd Nemotron 3.5 Lightning, en een routeringssysteem genaamd NeMo Switchyard. Samen maken ze het mogelijk om AI-taken slimmer en goedkoper uit te voeren.

Wat is Nemotron 3.5 Lightning precies?

Nemotron 3.5 Lightning is een AI-model met 30 miljard parameters. Dat klinkt groot — en dat is het ook — maar het bijzondere zit in de architectuur. Het model gebruikt een zogeheten mixture-of-experts-opzet. Dat betekent dat bij elke vraag of taak slechts een klein deel van het model actief wordt: zo'n 3 miljard van de 30 miljard parameters.

Vergelijk het met een groot kantoor waar honderd specialisten werken. Als er een klantvraag binnenkomt, hoef je niet alle honderd mensen wakker te maken — je stuurt de vraag naar de drie of vier collega's die er het meest van weten. De rest blijft zitten. Dat is in essentie wat dit model doet.

Volgens NVIDIA levert die aanpak tot vier keer snellere output op en worden agentic taken — denk aan AI-processen die meerdere stappen achter elkaar uitvoeren — zo'n 30% sneller afgerond dan bij vergelijkbare modellen.

Wat ik zelf opmerkelijk vind: het model draait volgens NVIDIA op een enkele pc met een RTX-videokaart. Dat is een vrij laagdrempelige hardwarevereiste. Je hebt dus niet per se een duur datacenter nodig om ermee aan de slag te gaan.

Waarom een open model ertoe doet

Nemotron 3.5 Lightning is een open model. Bedrijven kunnen het downloaden, gebruiken en aanpassen zonder toestemming van NVIDIA. Het is beschikbaar via onder meer Hugging Face, OpenRouter en NVIDIA's eigen platform.

Dat "aanpassen" is hier een belangrijk woord. Via NVIDIA's NeMo-framework kun je het model natrainen op je eigen bedrijfsdata. NVIDIA levert daarbij de trainingsrecepten en datasets. Eén bron meldt dat een bedrijf een eigen routeringsagent trainde in ongeveer twee uur, voor circa $85 aan kosten.

Voor een ondernemer betekent dit: je kunt een krachtig basismodel pakken en het specifiek maken voor jouw domein — of dat nu juridische teksten zijn, klantenservice, of technische documentatie — zonder dat je een team van tien machine-learning-engineers nodig hebt. Althans, dat is de belofte. Ik zou zelf willen zien hoe dat er in de praktijk uitziet voor een gemiddeld MKB-bedrijf.

NeMo Switchyard: de verkeersregelaar voor AI-modellen

Het tweede deel van de aankondiging vind ik eigenlijk nog interessanter vanuit ondernemersperspectief. NeMo Switchyard is een open-source bibliotheek die fungeert als een soort verkeersregelaar voor AI-verzoeken.

Stel dat je als ondernemer een AI-systeem hebt dat klant-e-mails beantwoordt. Sommige e-mails zijn simpel ("Wat zijn jullie openingstijden?"), andere zijn complex ("Ik wil een klacht indienen over een factuur van drie maanden geleden die niet klopt met de offerte"). Het is zonde om voor die eerste categorie een duur, zwaar model in te zetten.

Switchyard kijkt per verzoek welk model het beste past — op basis van complexiteit, kosten en nauwkeurigheid — en stuurt het daarheen. Dat kan een mix zijn van open modellen, eigen modellen en commerciële modellen van andere aanbieders.

De cijfers zijn opvallend

De kostencijfers die verschillende partijen melden, zijn behoorlijk concreet:

  • NVIDIA zelf claimt dat Switchyard de kosten terugbrengt tot ongeveer een derde vergeleken met het draaien van alles op een enkel topmodel.
  • LangChain rapporteert een kostenverlaging van 74% over 145 multi-turn taken, door slechts 7% van de verzoeken naar een zwaar model te sturen. Dat ging wel gepaard met een nauwkeurigheidsverlies van 6%.
  • Cognition (het bedrijf achter Devin) meldt 28% lagere kosten.
  • Ramp zegt de prestaties van een topmodel te evenaren terwijl de kosten 58% lager uitvielen en de doorlooptijd 33% korter werd.

Ik vind het belangrijk om erbij te zeggen: dit zijn cijfers van partijen die samenwerken met NVIDIA. Onafhankelijke benchmarks heb ik nog niet gezien. Maar de richting is consistent: slim routeren scheelt geld.

Wat betekent dit voor een ondernemer?

Laat me dit even vertalen naar de praktijk. Als je nu AI inzet in je bedrijf — of dat overweegt — dan betaal je waarschijnlijk per API-aanroep aan een aanbieder zoals OpenAI, Anthropic of Google. Elke vraag die je systeem stelt aan zo'n model kost geld.

De realiteit is dat veel van die vragen relatief eenvoudig zijn. Een routeringssysteem als Switchyard zou ervoor kunnen zorgen dat je alleen voor de moeilijke vragen het dure model aanspreekt, en de rest afhandelt met een lichter (en goedkoper) model.

Kun je je voorstellen wat dat betekent als je dagelijks honderden of duizenden AI-verzoeken verwerkt? Dan praat je al snel over een serieus verschil op de maandrekening.

De kanttekening

Er zit wel een belangrijke nuance aan. Om Switchyard goed in te zetten, moet je al een enigszins volwassen AI-infrastructuur hebben. Je moet weten welke taken je automatiseert, welke modellen je gebruikt, en hoe je die aan elkaar knoopt. Voor een bedrijf dat nog aan het experimenteren is met ChatGPT, is dit waarschijnlijk een paar stappen te ver.

Partners als LangChain, Kong en LiteLLM bieden wel integraties aan, wat de drempel verlaagt. Maar ik denk dat dit op dit moment vooral relevant is voor bedrijven die al actief AI-agents bouwen of laten bouwen.

Een markt die verschuift van model naar orkestratielaag

Wat mij opvalt aan deze aankondiging is de verschuiving die erachter zit. De concurrentie in AI gaat steeds minder over wie het beste model heeft. Het gaat steeds meer over wie het slim combineren van modellen het makkelijkst maakt.

NVIDIA verkoopt uiteindelijk chips. Hoe meer AI-modellen er draaien — groot en klein, duur en goedkoop, door elkaar heen — hoe meer rekenkracht er nodig is. Switchyard past perfect in die strategie: het moedigt aan om méér modellen te gebruiken, niet minder.

Dat is geen verwijt, het is een observatie. En het is ook niet per se slecht voor de gebruiker: als je inderdaad 60-70% kunt besparen op AI-kosten door slim te routeren, is dat winst — ook al verdient NVIDIA er indirect aan mee.

Voor mij is dit vooral een signaal dat de AI-markt volwassener wordt. Het gesprek verschuift van "welk model is het beste" naar "hoe zet ik modellen zo efficiënt mogelijk in". En dat is, wat mij betreft, precies het gesprek dat ondernemers zouden moeten voeren.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.