TL;DR
- Wat: Prime Intellect heeft Prime Agent gelanceerd — een open-source framework dat AI-modellen in staat stelt hun eigen werkwijze aan te passen terwijl ze aan een taak werken.
- Waarom relevant: Dit soort tools verlaagt de drempel om AI-agents in te zetten voor langlopende, complexe taken — zonder dat je zelf de technische orkestratie hoeft te bouwen.
- Wat je ermee kunt: Volg de ontwikkeling als je overweegt AI-agents te gebruiken voor softwareontwikkeling of geautomatiseerde workflows in je bedrijf.
Ik stuitte vanochtend op een aankondiging die me even stil liet staan. Prime Intellect — een AI-onderzoeksbedrijf — heeft een open-source tool uitgebracht genaamd Prime Agent. Het bijzondere: deze AI-agent kan zichzelf verbeteren terwijl hij aan een opdracht werkt. Ik vind dat een ontwikkeling die het volgen waard is, ook als je zelf geen developer bent.
Wat is Prime Agent precies?
Prime Agent is wat je noemt een coding harness — zeg maar een raamwerk waarbinnen een AI-model opereert. Denk aan het verschil tussen een losse werknemer en een werknemer met een compleet ingerichte werkplek, inclusief notitieblok, gereedschap en collega's die hij kan raadplegen. Het raamwerk maakt het model effectiever.
Wat mij hier opvalt: het enige gereedschap dat Prime Agent krijgt is een zogeheten persistent IPython kernel. Dat is in feite een Python-omgeving die blijft draaien — ook als een gesprek of sessie al lang bezig is. Vanuit die omgeving kan het model zijn eigen geschiedenis doorzoeken, sub-agents opstarten (denk aan: digitale collega's die parallel taken uitvoeren), en nuttige informatie opslaan buiten het directe gesprek.
Het systeem is gebouwd op twee pijlers:
- RLM (Recursive Language Model): Het model behandelt zijn eigen context als een variabele die het kan aanpassen. Sub-agents functioneren als "recursieve aanroepen" — ze zijn zelf ook weer volledige Prime Agent-instanties.
- Continual Harness: De hele configuratie — prompts, geheugen, vaardigheden — is aanpasbaar door het model zelf, zonder menselijke tussenkomst.
Zichzelf verbeteren met /refine
Het meest opvallende onderdeel is wat Prime Intellect het /refine-commando noemt. Stel dat de agent merkt dat een bepaalde aanpak niet werkt. Dan kan hij zijn eigen instructies, geheugen en vaardigheden bijwerken — midden in een taak.
Ik vind dit eerlijk gezegd fascinerend. De meeste AI-tools die ik zie werken met vaste instructies: je geeft ze een prompt, en ze voeren uit. Prime Agent draait dat om. Het model leest zijn eigen "trajectorie" (de stappen die het heeft gezet), analyseert wat wel en niet werkte, en past zichzelf aan. Er zit ook een terugdraaimogelijkheid in, voor het geval een aanpassing averechts werkt.
Voor de technisch geïnteresseerden: dit proces verloopt asynchroon. Dat betekent dat de planningsfase niet het lopende gesprek blokkeert — de aanpassingen worden pas toegepast op een natuurlijk omslagpunt.
De cijfers: van 0,37% naar boven menselijk niveau
Hier wordt het concreet. Prime Agent scoorde 95,5% op de ARC-AGI-3-benchmark, met het Opus 5-model van Anthropic. De menselijke expertbaseline op diezelfde benchmark is 95,4%. Dat verschil is klein, maar de context is groot.
Want toen ARC-AGI-3 eerder dit jaar werd gelanceerd, scoorde het beste AI-model — Googles Gemini 3.1 Pro — slechts 0,37%. Van minder dan één procent naar boven het menselijke expertniveau, in een paar maanden tijd. Dat is een tempo dat ik opmerkelijk vind.
Wat is ARC-AGI-3 eigenlijk?
ARC-AGI-3 is een interactieve benchmark die test of AI-agents kunnen omgaan met nieuwe omgevingen, zelf doelen kunnen ontdekken, en continu kunnen leren. De menselijke baseline is vastgesteld via focusgroepen in San Francisco, waarbij deelnemers onder gecontroleerde omstandigheden werden getest — één poging per omgeving, negentig minuten per sessie.
Het is dus geen eenvoudige kennisquiz, maar een test van adaptief probleemoplossend vermogen. Dat Prime Agent hier boven de menselijke baseline scoort, zegt iets over de effectiviteit van het zelfverbeterende mechanisme.
Daarnaast heeft Prime Agent volgens Prime Intellect werkende SEGA Genesis- en Game Boy Color-emulators gebouwd in de programmeertaal Rust — helemaal vanaf nul. Ik zou zelf willen weten hoeveel menselijke uren dat normaal kost om dat in perspectief te plaatsen, maar het geeft een beeld van de complexiteit die het systeem aankan.
Wat betekent dit voor ondernemers?
Laat ik eerlijk zijn: Prime Agent is op dit moment vooral interessant voor technische teams en softwareontwikkelaars. Je installeert het met je eigen API-sleutels, het draait met zowel open als gesloten AI-modellen, en de broncode staat op GitHub onder een MIT-licentie. Dat laatste betekent: je mag het vrij gebruiken, ook commercieel.
Maar de bredere implicatie is wat mij betreft relevanter voor ondernemers. Wat we hier zien is een verschuiving: AI-agents worden niet langer alleen slim door betere modellen, maar door betere werkprocessen rondom die modellen. Het raamwerk — hoe een agent zijn taken organiseert, zijn fouten analyseert, zijn aanpak bijstelt — wordt net zo belangrijk als het model zelf.
Kun je je voorstellen wat dit betekent als je straks AI-agents inzet voor taken in je bedrijf? Niet alleen code schrijven, maar bijvoorbeeld geautomatiseerde data-analyses, het opzetten van rapportages, of het beheren van complexe workflows. Een agent die zichzelf verbetert naarmate hij langer draait, wordt waardevoller over tijd — vergelijkbaar met een medewerker die steeds beter wordt in zijn rol.
Een kanttekening
Ik wil wel benadrukken: benchmarkscores vertalen zich niet altijd één-op-één naar praktijkwaarde. Dat Prime Agent goed scoort op ARC-AGI-3 is indrukwekkend, maar het zegt nog niet alles over hoe betrouwbaar het systeem is in een bedrijfsomgeving met echte randvoorwaarden — denk aan beveiliging, compliance, of het werken met bestaande systemen. Dat zijn vragen die nog beantwoord moeten worden naarmate dit soort tools volwassener wordt.
Een signaal om te volgen
Voor mij is dit vooral een signaal dat de AI-agent-wereld snel beweegt — en dat open-source daarin een serieuze rol speelt. Het feit dat een relatief klein onderzoeksbedrijf als Prime Intellect een tool kan bouwen die op bepaalde benchmarks boven menselijk expertniveau scoort, en die vervolgens gratis beschikbaar stelt, vind ik een interessante dynamiek. Het betekent dat de technologie niet exclusief blijft voor grote techbedrijven met diepe zakken.
Of Prime Agent zelf de tool is die jij straks in je bedrijf gebruikt? Dat durf ik niet te zeggen. Maar de principes erachter — zelfverbetering, persistent geheugen, modulaire sub-agents — die gaan we volgens mij steeds vaker tegenkomen. En daar is het de moeite waard om nu al oog voor te hebben.
80% van de AI-projecten haalt productie nooit.
Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.