Nvidia's nieuwe AI-router kiest per taak het goedkoopste model

TL;DR

  • Wat: Nvidia bracht NeMo Switchyard uit, een open-source router die AI-taken automatisch naar het goedkoopste geschikte model stuurt — in eigen tests tot een derde van de kosten van één topmodel.
  • Waarom relevant: AI-kosten zijn voor veel bedrijven een drempel; dit maakt het betaalbaar om AI-agents in te zetten zonder altijd het duurste model te draaien.
  • Wat je ermee kunt: Inventariseer welke AI-taken in je bedrijf echt een topmodel nodig hebben — de kans is groot dat het minder zijn dan je denkt.

Ik stuitte op een tweet van @2xnmore die stelde dat Nvidia — misschien onbedoeld — het idee van gedecentraliseerde AI heeft bevestigd. Niet door één almachtig model te lanceren, maar door een router te bouwen die per taak het goedkoopste capabele model kiest. Dat trok mijn aandacht, want dit raakt direct aan een vraag die ik vaker hoor: "AI klinkt leuk, maar wat kost het?"

Wat heeft Nvidia precies uitgebracht?

Nvidia lanceerde op 11 augustus 2026 twee dingen tegelijk: Nemotron 3.5 Lightning, een open AI-model van 30 miljard parameters, en NeMo Switchyard, een open-source routeringsbibliotheek.

De combinatie is interessant. Nemotron 3.5 Lightning is een relatief licht model dat volgens Nvidia op één enkele GPU kan draaien — dus ook op een krachtige desktop. Het is gratis te downloaden, gebruiken en aanpassen. NeMo Switchyard is de dirigent: het stuurt iedere stap binnen een AI-workflow naar het model dat die stap het beste en goedkoopste kan uitvoeren.

Stel dat je als ondernemer een AI-agent hebt die klantvragen beantwoordt. Sommige vragen zijn simpel ("Wat zijn jullie openingstijden?"), andere complex ("Ik heb een klacht over een bestelling van drie weken geleden die deels retour is maar nog niet gecrediteerd"). Tot nu toe zou je voor zekerheid alles door een duur topmodel laten afhandelen. Switchyard doet iets anders: het routeert de simpele vraag naar een goedkoop model en escaleert pas naar een duurder model als de complexiteit dat vereist.

De cijfers: wat levert het op?

Nvidia's eigen benchmarks laten zien dat NeMo Switchyard de nauwkeurigheid op het niveau van een topmodel houdt, terwijl de kosten zakken naar ongeveer een derde van wat het zou kosten om alles via Claude Opus 4.8 (een van de krachtigste modellen op dit moment) te laten lopen.

Dat klinkt abstract, dus hier een concreter voorbeeld. LangChain testte de router op 145 complexe, meerstaps AI-taken. Het resultaat: 74% kostenbesparing, doordat slechts 7% van de verzoeken naar het dure topmodel ging. De rest werd afgehandeld door het lichtere Nemotron-model. De prijs daarvoor was een nauwkeurigheidsverlies van zo'n 6 procentpunt — dat is niet niks, maar voor veel zakelijke toepassingen acceptabel.

Een ander voorbeeld: softwarebedrijf Ramp zette Switchyard in voor programmeertaken en haalde dezelfde prestaties als een topmodel, maar dan 58% goedkoper en 33% sneller. Cognition, dat AI-programmeeragents bouwt, routeerde tussen twee modellen en kwam uit op een kostenverlaging van 28% met slechts 2,8 procentpunt minder nauwkeurigheid.

Hoe werkt die router precies?

NeMo Switchyard biedt meerdere routeringsstrategieën. Ik vind het handig om ze te vergelijken met hoe je in een bedrijf werk verdeelt:

Escalatierouter

Dit is de meest intuïtieve aanpak. De router begint altijd bij het goedkoopste model. Pas als dat model vastloopt of aangeeft dat een taak te complex is, escaleert het naar een duurder model. Vergelijk het met een helpdesk: de eerstelijnsmedewerker pakt de standaardvragen, de specialist komt er pas bij als het nodig is.

Faserouter

Deze kijkt naar welke fase een taak in zit. Moet de AI alleen informatie ophalen? Dan volstaat een licht model. Moet het daarna een analyse maken en een beslissing nemen? Dan schakelt het een zwaarder model in. Het bespaart geld door per stap te kiezen, niet per hele taak.

LLM-classifier

Hierbij beoordeelt een apart AI-model welk ander model het meest geschikt is voor de binnenkomende vraag. Iets duurder door die extra beoordelingsstap, maar potentieel nauwkeuriger in de routering.

Wat mij opvalt: geen van deze strategieën is bijzonder complex. Het principe — niet alles door je duurste oplossing jagen — is iets dat iedere ondernemer herkent. Het verschil is dat Nvidia dit nu als kant-en-klare, open-source tooling aanbiedt.

Waarom dit voor ondernemers relevant is

AI-kosten zijn geen vast gegeven meer. Tot voor kort had je als bedrijf grofweg twee opties: een duur topmodel gebruiken voor alles, of een goedkoop model gebruiken en accepteren dat het minder kan. Die keuze wordt nu genuanceerder.

Kun je je voorstellen wat dit betekent als je tientallen of honderden AI-taken per dag draait? Een klantenservicebot, een tool die offertes controleert, een systeem dat facturen verwerkt — elk van die taken heeft een ander complexiteitsniveau. Als 90% van je verzoeken prima afgehandeld kan worden door een model dat een fractie kost van het topmodel, dan praat je over serieuze besparingen.

Ik vind het ook noemenswaardig dat Nvidia dit open-source uitbrengt. Je bent niet gebonden aan Nvidia's eigen modellen; Switchyard werkt met modellen van verschillende aanbieders. Dat geeft je als ondernemer keuzevrijheid — je kunt het systeem laten routeren tussen bijvoorbeeld een open model dat je zelf draait en een commercieel model in de cloud.

Het bredere signaal

De tweet van @2xnmore stelt dat Nvidia hiermee — misschien onbedoeld — het idee van gedecentraliseerde AI valideert. Ik snap die lezing. De boodschap van Nvidia is in feite: er is geen enkel model dat alles het beste doet. De toekomst is een ecosysteem van gespecialiseerde modellen met een slimme laag ertussen die bepaalt wie wat doet.

Of dat specifiek "gedecentraliseerde AI" is zoals crypto-enthousiastelingen het bedoelen — dat laat ik even in het midden. Maar het principe is helder: de waarde verschuift van het model zelf naar de orkestratie van modellen. En die orkestratie is nu open-source en gratis beschikbaar.

Voor mij is dit vooral een signaal dat AI-kosten de komende tijd flink gaan dalen — niet doordat modellen goedkoper worden, maar doordat we slimmer leren kiezen welk model we waarvoor inzetten. En dat is, wat mij betreft, relevanter voor de gemiddelde ondernemer dan welk nieuw model dan ook.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.