TL;DR
- Wat: Cohere heeft North Micro Vision uitgebracht, een open-source vision-language model van 2,4 miljard parameters dat documenten, grafieken en afbeeldingen kan lezen en begrijpen.
- Waarom relevant: Kleine, gespecialiseerde AI-modellen maken documentverwerking bereikbaar voor bedrijven die geen groot cloudbudget of technisch team hebben.
- Wat je ermee kunt: Evalueer of geautomatiseerde documentherkenning (facturen, formulieren, bonnetjes) voor jouw bedrijf haalbaar wordt met een model dat je lokaal kunt draaien.
Cohere, het Canadese AI-bedrijf dat zich vooral op zakelijke toepassingen richt, heeft een nieuw model aangekondigd: North Micro Vision. Het is hun kleinste vision-language model tot nu toe, specifiek gebouwd voor documentherkenning. Ik vind het interessant omdat het precies in een trend past die ik al langer volg: AI-modellen worden niet alleen groter, maar juist ook kleiner en gerichter.
Wat is North Micro Vision precies?
North Micro Vision is een zogenaamd vision-language model (VLM). Dat is een AI-model dat zowel tekst als beelden kan verwerken — denk aan een foto van een factuur, een grafiek uit een jaarverslag, of een screenshot van een formulier. Het model "leest" wat er op de afbeelding staat en kan daar vragen over beantwoorden of gestructureerde informatie uit halen.
Het model heeft 2,4 miljard parameters. Dat klinkt misschien als veel, maar in AI-termen is dit juist klein. Ter vergelijking: de grote taalmodellen van Google en OpenAI zitten op honderden miljarden parameters. North Micro Vision bestaat uit twee delen: een taalmodel van 2 miljard parameters en een vision encoder van 400 miljoen parameters, gebaseerd op SigLIP 2. Die vision encoder is het onderdeel dat afbeeldingen omzet naar informatie die het taalmodel kan verwerken.
Wat mij opvalt is dat Cohere kiest voor wat ze "native-resolution image processing" noemen. Dat betekent dat het model afbeeldingen verwerkt in hun oorspronkelijke beeldverhouding, zonder ze eerst bij te snijden of te vervormen. Voor documentherkenning is dat belangrijk: een factuur in staand formaat wordt anders behandeld dan een breed Excel-overzicht, en details gaan niet verloren door herschaling.
Hoe presteert het?
Cohere deelt een aantal benchmarkresultaten. Op Document VQA — een standaardtest waarbij het model vragen moet beantwoorden over documenten — scoort North Micro Vision 0,921. Op Chart QA, waarbij het grafieken moet interpreteren, haalt het 0,808. Het model ondersteunt ook visuele grounding (het kan aanwijzen wáár in een afbeelding iets staat) en werkt in meerdere talen.
Die scores zijn opvallend voor een model van deze omvang. Volgens recente vergelijkingen in de markt presteren sommige modellen met tientallen keren meer parameters vergelijkbaar of slechts marginaal beter op dit soort taken. Het Chinese GLM-OCR, met nog minder parameters (0,9 miljard), liet eerder dit jaar al zien dat kleine modellen verrassend goed kunnen scoren op documentherkenning. Ik denk dat we hier een patroon zien: voor specifieke taken zoals OCR en documentverwerking heb je niet per se een gigantisch model nodig.
Wat het model niet kan
Cohere is er eerlijk over: North Micro Vision is geen reasoning-model. Het kan niet complex redeneren, geen code schrijven en geen tools aansturen. Het is gebouwd voor één ding — documenten begrijpen — en dat doet het goed. Wie een model zoekt dat ook kan plannen, rekenen of agents aanstuurt, moet naar grotere modellen kijken.
Open source en Apache 2.0: wat betekent dat?
Het model is uitgebracht onder een Apache 2.0-licentie. In gewone taal: je mag het gratis gebruiken, aanpassen en commercieel inzetten zonder restricties. De modelgewichten staan op Hugging Face, het platform waar ontwikkelaars AI-modellen delen en downloaden.
Dit is niet vanzelfsprekend. Veel AI-bedrijven brengen modellen uit met licenties die commercieel gebruik beperken of alleen via hun eigen betaalde API toegankelijk zijn. Dat Cohere dit model volledig open beschikbaar stelt, past in hun bredere strategie: eerder dit jaar brachten ze North Mini Code uit, een codemodel van 30 miljard parameters, ook onder Apache 2.0.
Voor ondernemers is dit relevant omdat het betekent dat je het model kunt draaien zonder maandelijkse API-kosten. Met 2,4 miljard parameters is het compact genoeg om op relatief bescheiden hardware te draaien — al hangt het exacte geheugengebruik af van de implementatie en of je een geoptimaliseerde versie gebruikt.
Wat betekent dit voor ondernemers?
Stel dat je als ondernemer dagelijks tientallen facturen, pakbonnen of inkooporders verwerkt. Traditioneel gebruik je daar OCR-software voor, of — in veel MKB-bedrijven — handwerk. Vision-language modellen zoals North Micro Vision bieden een tussenweg: ze herkennen niet alleen tekst, maar begrijpen ook de structuur van een document. Ze kunnen onderscheid maken tussen een factuurnummer, een btw-bedrag en een leveranciersnaam, zonder dat je voor elk documenttype aparte regels hoeft in te stellen.
De praktische drempel zit op dit moment nog in de implementatie. Je hebt technische kennis nodig om zo'n model te integreren in je werkproces, of je schakelt een developer of IT-partner in. Maar het feit dat dit soort modellen open en gratis beschikbaar komt, verlaagt de instapdrempel. Een jaar geleden had je voor vergelijkbare functionaliteit een dure enterprise-licentie nodig of was je afhankelijk van cloud-API's met kosten per verwerkt document.
De bredere trend
Wat ik hier zie is een verschuiving in de AI-markt. Bedrijven als Cohere, maar ook Zhipu AI met GLM-OCR en Meta met kleinere Llama-varianten, brengen steeds gerichtere modellen uit die één taak heel goed doen. Voor ondernemers is dat relevanter dan de race naar het grootste en slimste algemene model. Je hebt geen model nodig dat filosofische essays kan schrijven als je facturen wilt verwerken.
Kun je je voorstellen wat dit betekent als documentverwerking een bottleneck is in je bedrijf? De kosten van AI-gestuurde documentherkenning dalen, de kwaliteit stijgt, en de afhankelijkheid van grote techplatformen neemt af doordat modellen open beschikbaar komen.
Een model met een duidelijke plek
Voor mij is North Micro Vision vooral een bevestiging van een ontwikkeling die ik al langer volg: de beste AI-tools voor het bedrijfsleven worden niet per se groter, maar gerichter. Een model van 2,4 miljard parameters dat documenten begrijpt, open source is en op bescheiden hardware kan draaien — dat is precies het soort ontwikkeling waar je als ondernemer op kunt anticiperen. Niet omdat je het morgen moet implementeren, maar omdat het laat zien dat de technologie steeds toegankelijker wordt voor wie er concreet iets mee wil doen.
80% van de AI-projecten haalt productie nooit.
Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.