TL;DR
- Wat: AI-model Grok 4.5 van xAI heeft in acht minuten een wiskundig vermoeden weerlegd waar wiskundigen circa dertig jaar niet uitkwamen.
- Waarom relevant: AI-modellen verschuiven van tekstgeneratie naar daadwerkelijk probleemoplossend vermogen — dat raakt ook complexe bedrijfsvraagstukken.
- Wat je ermee kunt: Volg hoe AI-modellen zich ontwikkelen op het vlak van redeneren, want dát bepaalt straks wat ze voor jouw bedrijfsvoering kunnen betekenen.
Ik scrollde deze week langs een tweet van Elon Musk: "Grok 4.5 just solved a graph theory conjecture that has been open for ~30 years." Dat soort claims zie je vaker voorbijkomen, maar toen ik me erin verdiepte, bleek het verhaal genuanceerder — én interessanter — dan de tweet alleen.
Wat is er precies gebeurd?
Het begon bij onderzoeker Dmitry Rybin, die op X deelde dat hij met behulp van OpenAI's GPT-5.6 Pro een tegenvoorbeeld had gevonden voor het zogenoemde Dinitz-Garg-Goemans-vermoeden. Dat is een stelling uit de grafentheorie — een tak van de wiskunde die zich bezighoudt met netwerken van verbindingen — die zo'n dertig jaar onbewezen was gebleven.
Kort daarna deelde een medewerker van xAI dat hun interne AI-agent "Capy", draaiend op Grok 4.5 Medium, in een Slack-gesprek zelfstandig een verwant open probleem oppakte: Graffiti Conjecture 284, ook al tientallen jaren onopgelost. Binnen acht minuten had het model een tegenvoorbeeld geconstrueerd.
Elon Musk pikte dat op en twitterde erover. Wat hij niet vermeldde: het oorspronkelijke Dinitz-Garg-Goemans-resultaat kwam van GPT-5.6 Pro, niet van Grok. Dat vind ik wel relevant om te weten als je het nieuws op waarde wilt schatten.
Waar gaat dat vermoeden over?
Ik zal je niet vermoeien met de volledige wiskundige formulering, maar het kernidee is best te volgen.
Stel je een netwerk voor — denk aan wegen tussen steden, of verbindingen in een logistiek systeem. Er zijn twee manieren om goederen door zo'n netwerk te sturen:
- Fractionele stroom: je mag ladingen splitsen over meerdere routes. Flexibel, theoretisch optimaal.
- Ondeelbare stroom (unsplittable flow): elke lading moet als geheel over één route. Praktischer, maar duurder.
Het Dinitz-Garg-Goemans-vermoeden stelde, kort gezegd, dat het kostenverschil tussen die twee benaderingen binnen bepaalde grenzen bleef. Rybin vond met GPT-5.6 Pro een concreet netwerk waar de fractionele stroom 58 kost, terwijl elke ondeelbare variant minstens 60 kost — buiten de veronderstelde grenzen. Daarmee is het vermoeden weerlegd.
Wat mij hier opvalt: dit is geen vaag "AI genereert een mooi antwoord". Dit is een concreet, verifieerbaar wiskundig tegenvoorbeeld. Dat is een wezenlijk verschil.
Hoe betrouwbaar is dit resultaat?
Dit is waar ik even de rem erop wil zetten. Want een tweet is geen wetenschappelijke publicatie.
Volgens berichtgeving heeft een wiskundige die eerder aan het probleem werkte het tegenvoorbeeld bevestigd. Maar er is op het moment van schrijven geen peer-reviewed paper gepubliceerd, en geen onafhankelijke formele verificatie door een ander team. De website Basenor noemt het treffend: "a promising signal, not a settled result."
Ik vind dat een eerlijke samenvatting. Het resultaat ziet er solide uit, maar de wiskundige gemeenschap hanteert — terecht — een hogere lat dan een Slack-conversatie en een tweet.
Wat ik ook opmerkelijk vind: binnen dagen na de eerste claim pakten meerdere AI-systemen vergelijkbare open problemen op. Cognition's Devin-agent loste er nog een paar op. Het lijkt alsof er een soort wedloop is ontstaan — niet tussen wiskundigen, maar tussen AI-labs.
Wat betekent dit voor je als ondernemer?
Je denkt misschien: leuk, maar wat heb ik aan grafentheorie? Dat is een eerlijke vraag. Het directe antwoord is: waarschijnlijk niets. Maar het indirecte signaal is wel degelijk relevant.
Redeneervermogen groeit snel
Wat deze modellen hier laten zien is niet "tekst genereren" maar redeneren over complexe problemen. Dezelfde vaardigheid die een wiskundig vermoeden kan weerleggen, is verwant aan het soort denken dat nodig is voor:
- Logistieke optimalisatie (ironisch genoeg precies waar dit vermoeden over gaat)
- Complexe planningsvraagstukken
- Financiële scenario-analyses
- Het doorrekenen van bedrijfsmodellen met veel variabelen
Stel dat je als MKB-ondernemer een distributienetwerk hebt met twintig afleverpunten. De vraag "wat is de goedkoopste route als ik ladingen niet mag splitsen?" is letterlijk het type probleem waar dit vermoeden over gaat. We zijn er nog niet dat je dit in een chatvenster typt en een kant-en-klaar antwoord krijgt, maar de richting is duidelijk.
De AI-modellen worden elkaars benchmark
Wat mij ook opvalt: dit resultaat werd niet door één model gevonden. GPT-5.6 Pro kwam er eerst, Grok 4.5 volgde kort daarna, en Devin pakte verwante problemen op. Voor ondernemers die kiezen tussen AI-tools is dat een interessant gegeven. De concurrentie tussen deze modellen is intens, en dat drukt de prijzen terwijl de kwaliteit stijgt. Grok 4.5 wordt volgens analyses aangeboden voor meer dan 60% minder dan vergelijkbare modellen van concurrenten.
De nuance achter de headline
Ik wil eerlijk zijn: Elon Musks tweet is typisch Musk. Hij claimt het resultaat voor Grok, terwijl het oorspronkelijke werk met GPT-5.6 Pro werd gedaan. Het Grok-resultaat betreft een verwant maar ander vermoeden (Graffiti Conjecture 284). Beide resultaten zijn indrukwekkend, maar de framing is selectief.
Dat is geen beschuldiging — het is marketing, en elke CEO doet het. Maar als ondernemer die AI-tools evalueert, wil je het volledige plaatje. En dat plaatje is: meerdere AI-modellen laten nu zien dat ze wiskundige problemen kunnen oplossen die jarenlang open stonden. Dat is het echte signaal.
Ik merk ook dat er nog geen formele verificatie is. Dat klinkt misschien als een detail, maar in de wetenschap is het verschil tussen "klopt waarschijnlijk" en "bewezen" aanzienlijk. Ik zou zeggen: houd de arXiv-publicaties in de gaten.
Voor mij is dit vooral een signaal dat AI-modellen een fase ingaan waarin ze niet alleen antwoorden geven, maar problemen oplossen. Dat is een verschil dat er voor ondernemers toe gaat doen — misschien niet vandaag, maar eerder dan de meesten verwachten.
80% van de AI-projecten haalt productie nooit.
Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.