Upstage Solar Pro 4: van 14 naar 42 in één generatie

TL;DR

  • Wat: Het Koreaanse AI-lab Upstage bracht Solar Pro 4 uit, een reasoning-model dat driemaal hoger scoort dan zijn voorganger op een onafhankelijke benchmark.
  • Waarom relevant: De grootste verbeteringen zitten in agentic taken — precies het type werk (documenten verwerken, tools aansturen) waar MKB-toepassingen naar toe bewegen.
  • Wat je ermee kunt: Bekijk of de tijdelijke API-prijs (90% korting tot 10 september) interessant is om te testen naast je huidige AI-model.

Afgelopen week bracht het Koreaanse AI-lab Upstage zijn nieuwe vlaggenschipmodel uit: Solar Pro 4. Wat mij deed opkijken is de sprong op de Artificial Analysis Intelligence Index — van 14 naar 42 in één modelgeneratie. Ik wilde uitzoeken wat er achter die cijfers zit en wat het praktisch betekent.

Wat is er precies veranderd?

Solar Pro 3 kwam in april 2026 uit en scoorde 14 op de Artificial Analysis Intelligence Index. Dat is een samengestelde benchmark die AI-modellen meet op vier gelijkgewogen categorieën: agents, codering, algemene capaciteit en wetenschappelijk redeneren. Een score van 14 plaatste Solar Pro 3 in de onderste regionen van het speelveld.

Solar Pro 4 scoort nu 42. Ter vergelijking: de huidige koploper, Claude Opus 5, staat op 63. Solar Pro 4 zit daarmee in de buurt van modellen als MiMo-V2.5-Pro (43). Het is dus niet het allerbeste model op de markt, maar de sprong van 14 naar 42 — een verdrievoudiging — in een paar maanden tijd is opvallend.

Wat mij hier het meest opvalt: de grootste winst zit niet in "meer weten", maar in "beter taken uitvoeren". Op Terminal-Bench v2.1, een test voor het autonoom uitvoeren van agentic taken, ging de score van 12% naar 57%. Op lange-documentredenering (AA-LCR) van 31% naar 71%. Dat zijn geen marginale verbeteringen.

Minder halluccineren door vaker "ik weet het niet" te zeggen

Dit vind ik eerlijk gezegd een van de meest interessante details. Volgens de analyse van Artificial Analysis verbeterde Solar Pro 4 zijn score op de hallucinatiebenchmark niet door méér te weten, maar door selectiever te antwoorden. Solar Pro 3 probeerde 92% van de vragen te beantwoorden en hallucineerde bij 88% daarvan. Solar Pro 4 probeert slechts 41% van de vragen en hallucineerde daarbij nog maar 24% van de tijd.

Voor een ondernemer klinkt "het model slaat vaker over" misschien als een nadeel. Maar stel dat je als ondernemer een AI-systeem gebruikt dat contracten of facturen verwerkt. Wat heb je liever: een systeem dat altijd een antwoord geeft maar er vaak naast zit, of een systeem dat zegt "dit weet ik niet zeker" en je de kans geeft om zelf te kijken? Ik denk dat de meeste ondernemers de tweede optie verkiezen.

Wat kost het en hoe kom je erbij?

Upstage lanceerde Solar Pro 4 met een opvallend scherpe introductieprijs. Tot 10 september 2026 geldt een korting van 90% op de API-prijs:

  • Input: $0,30 per miljoen tokens
  • Output: $1,20 per miljoen tokens
  • Gecachte input: $0,06 per miljoen tokens

Om dat in perspectief te plaatsen: een miljoen tokens is ruwweg 750.000 woorden — meer dan tien dikke romans. Voor dertig dollarcent kun je dat volume aan tekst als input aan het model voeren. Na de introductieperiode worden de prijzen tien keer hoger, maar zelfs dan blijft het relatief betaalbaar vergeleken met topmodellen.

Het model is beschikbaar via de eigen Upstage Console, via OpenRouter, en via het Hermes Agent-platform van Nous Research. De API is OpenAI-compatibel, wat betekent dat je in veel gevallen alleen de endpoint en API-sleutel hoeft te wisselen als je al met de OpenAI API werkt.

Specificaties in het kort

  • Contextvenster: tot 512K tokens (Upstage zelf meldt dit; Artificial Analysis noemt 384K — het verschil is niet helemaal duidelijk)
  • Maximale output: 128K tot 256K tokens, afhankelijk van de bron
  • Talen: Engels, Koreaans, Japans
  • Reasoning-effort dial: je kunt instellen hoeveel "denkwerk" het model doet, een afweging tussen diepte en snelheid

Dat het model alleen Engels, Koreaans en Japans ondersteunt, is voor Nederlandse ondernemers een kanttekening. In de praktijk werken veel modellen redelijk in het Nederlands als ze sterk zijn in het Engels, maar officiële ondersteuning ontbreekt hier.

Wat betekent dit voor een ondernemer?

De AI-modellenmarkt is in 2026 enorm breed geworden. Er staan inmiddels meer dan 140 modellen op de Artificial Analysis-ranglijst. Voor een ondernemer die AI wil inzetten, wordt de vraag steeds minder "welk model is het beste?" en steeds meer "welk model past bij mijn specifieke taak en budget?"

Solar Pro 4 positioneert zich nadrukkelijk op wat Upstage "agentic work" noemt: taken waarbij het model zelfstandig meerdere stappen doorloopt. Denk aan het doorlezen van een lang document, het aanroepen van externe tools, en het opleveren van een resultaat. Stel dat je een proces hebt waarbij binnenkomende e-mails worden geclassificeerd, relevante informatie wordt opgezocht in een database, en een conceptantwoord wordt opgesteld — dat is het type workflow waar dit model op mikt.

De lage introductieprijs maakt het daarnaast aantrekkelijk om te experimenteren. Als je al een toepassing draait op een ander model en benieuwd bent of een goedkoper alternatief vergelijkbare kwaliteit levert, dan is de komende weken een relatief risicoloze manier om dat te testen.

Een kanttekening bij de cijfers

Wel belangrijk: een score van 42 op een index klinkt indrukwekkend als je het vergelijkt met de 14 van de voorganger, maar het plaatst Solar Pro 4 in het middensegment van de huidige modellen. De topmodellen van Anthropic en OpenAI scoren boven de 60. Ik denk dat het eerlijk is om Solar Pro 4 te zien als een model dat de sprong maakt van "niet serieus meedoen" naar "een reëel alternatief in bepaalde categorieën".

Een Koreaans lab dat ineens meetelt

Wat mij het meest bijblijft aan dit verhaal is niet zozeer het model zelf, maar wat het zegt over de AI-markt. Een paar jaar geleden was de modellenrace een wedstrijd tussen een handvol Amerikaanse bedrijven. Nu brengt een Koreaans lab in één generatie een model uit dat drie keer zo goed scoort als zijn voorganger en op sommige taken boven menselijke baselines presteert.

Voor mij is dit vooral een signaal dat de keuze voor ondernemers alleen maar groter wordt — en dat "het beste model" steeds vaker afhangt van de specifieke taak, niet van de merknaam.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.