Grok 4.6 scoort hoog op benchmarks — maar is het de beste?

TL;DR

  • Wat: xAI bracht Grok 4.6 uit op 12 augustus 2026. Het model wint op kenniswerk-benchmarks, maar staat vierde in de overkoepelende ranglijst.
  • Waarom relevant: De prijs per taak ligt fors lager dan bij concurrenten — interessant als je AI-kosten wilt beheersen.
  • Wat je ermee kunt: Vergelijk je huidige AI-abonnement of API-kosten met Grok 4.6 als je vooral tekstwerk en kennistaken automatiseert.

Elon Musk tweette deze week dat Grok 4.6 de nummer één is op een benchmark. Dat klopt — maar het verhaal is genuanceerder dan één tweet laat zien. Ik dook in de cijfers, want juist die nuance maakt uit als je als ondernemer keuzes maakt over AI-tools.

Wat Grok 4.6 precies scoort

Grok 4.6 scoort 60,92 op de Artificial Analysis Intelligence Index, een onafhankelijke samengestelde score van negen benchmarks. Dat plaatst het model op de vierde plek:

  1. Claude Opus 5 — 63,05
  2. Claude Fable 5 — 62,07
  3. GPT-5.6 Sol Max — 60,93
  4. Grok 4.6 — 60,92

Wat mij hier opvalt: het verschil met GPT-5.6 Sol Max is 0,01 punt. Dat is zo klein dat het statistisch nauwelijks iets zegt.

Maar Musk had het over "this benchmark" — enkelvoud. En daar zit het punt. Op specifieke kenniswerk-benchmarks wint Grok 4.6 wél. Op GDPval-AA v2 haalt het 1753 punten (hoogste in de vergelijking), op AA-Briefcase 1577, en op Harvey LAB — een juridische evaluatie — scoort het 15,8%, tegenover 2,5% voor GPT-5.6 Sol. Dat is ruim zes keer zo hoog.

Tegelijkertijd verliest Grok 4.6 op software-engineering-benchmarks: DeepSWE v1.1 (-7 punten) en Terminal-Bench v3.0 (-8 punten), beide ten opzichte van GPT-5.6 Sol.

Ik vind het eerlijk gezegd een goed voorbeeld van hoe één benchmark-claim een heel ander beeld kan schetsen dan het totaalplaatje.

De kosten vertellen een ander verhaal

Waar Grok 4.6 zich écht onderscheidt, is op prijs en efficiëntie. De API kost $2 per miljoen input-tokens en $6 per miljoen output-tokens. Ter vergelijking: GPT-5.6 Sol zit op $5/$30 — dat is meer dan drie keer zo duur aan de output-kant.

Maar het gaat verder dan de prijs per token. Grok 4.6 rondt taken af in ruwweg de helft van de reasoning-stappen die Claude Opus 5 nodig heeft, met een kwart van de input-tokens. Een onafhankelijke test kwam uit op gemiddeld $0,84 per taak. Dat zijn cijfers waar je als ondernemer iets mee kunt.

Stel dat je als ondernemer dagelijks 50 taken door een AI-model laat verwerken — denk aan het samenvatten van contracten, het beantwoorden van klantvragen, of het analyseren van marktdata. Dan telt het verschil tussen $0,84 en pakweg $2,50 per taak snel op.

Er zit wel een kanttekening aan. Zodra je prompts boven de 200.000 tokens komen, verdubbelt de prijs over de hele prompt — niet alleen over het stuk dat erover gaat. Dat is ongebruikelijk en kan verrassend uitpakken als je met grote documenten werkt.

Wat er beter werd — en wat niet

Grok 4.6 verscheen 35 dagen na versie 4.5. Dat is een snel tempo. Er zijn duidelijke verbeteringen:

  • De score op SWE-bench steeg van circa 86% naar 95,6%
  • Een nieuw xhigh reasoning-niveau geeft meer denkruimte bij complexe vragen
  • Eén onafhankelijke security-tester loste 14 van 16 Hack The Box-uitdagingen op met nul false positives

Maar er zijn ook punten die achteruitgingen:

  • De tijd tot het eerste antwoord steeg van 8,7 naar 31,2 seconden — meer dan drie keer zo lang
  • De output-snelheid (65,5 tokens per seconde) plaatst het model op plek 17 van 20
  • Het contextvenster van 500.000 tokens is het kleinste onder de frontier-modellen
  • Agentic coding — het zelfstandig uitvoeren van programmeertaken — ging licht achteruit van 56,5% naar 54,2%

Die langere wachttijd is iets om in de gaten te houden. Als je AI inzet voor klantenservice of live-ondersteuning, zijn 31 seconden wachten merkbaar.

Wat dit betekent als je AI overweegt voor je bedrijf

Volgens recente cijfers gebruikt ongeveer 18% van de Nederlandse MKB-bedrijven inmiddels een of meer vormen van AI, tegenover 11% in 2024. De meest gebruikte toepassingen: generatieve AI voor content (42%), boekhouding en facturatie (28%), en chatbots voor klantenservice (21%).

Kun je je voorstellen wat het betekent als die chatbot per taak de helft goedkoper kan draaien? Of als het samenvatten van juridische documenten — denk aan huurcontracten, leveringsvoorwaarden, SLA's — zes keer nauwkeuriger gebeurt dan bij een concurrent-model?

Ik denk dat de werkelijke waarde van Grok 4.6 niet in dat ene benchmark-record zit, maar in de verhouding tussen kwaliteit en kosten. Voor ondernemers die al met AI-API's werken of dat overwegen, is het model interessant als werkhorse voor kennistaken.

Tegelijkertijd is het eerlijk om te benoemen: als je software laat ontwikkelen door AI, of als je grote contexten nodig hebt (lange rapporten, hele codebases), zijn er modellen die daar beter in zijn.

De claim versus de werkelijkheid

Elon Musk is niet de eerste die één benchmark uitlicht en de rest onvermeld laat — dat doen alle AI-bedrijven. Wat mij betreft is dat geen kwaadaardigheid, maar marketing. Het is wel iets om als ondernemer doorheen te kijken.

De les die ik hieruit trek: kijk niet naar één score, maar naar het profiel van een model. Waar is het sterk? Waar zwak? Wat kost het per taak die jij daadwerkelijk uitvoert? Die vragen zijn relevanter dan welk model bovenaan welke ranglijst staat.

Voor mij is dit vooral een signaal dat de AI-markt volwassener wordt. Het gaat steeds minder om wie de hoogste score heeft, en steeds meer om wie de beste verhouding biedt tussen prestatie, kosten en snelheid voor jouw specifieke werkzaamheden.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.