TL;DR
- Wat: Alibaba lanceert de publieke bèta van Wan 3.0, een AI-videomodel dat clips tot 30 seconden genereert op basis van tekst, beeld, audio én documenten.
- Waarom relevant: Het model komt onder een Apache 2.0-licentie — dat betekent dat je het gratis mag gebruiken voor commerciële toepassingen, zonder abonnementskosten.
- Wat je ermee kunt: Inventariseer of AI-gegenereerde video een rol kan spelen in je marketing of productcommunicatie, en test het model via de publieke bèta.
Vandaag kondigde Alibaba's Wan-team de publieke bèta aan van Wan 3.0, hun nieuwste AI-videogenerator. Ik viel over dit bericht omdat het een aantal dingen combineert die ik tot nu toe niet samen in één model heb gezien: langere videoclips, input vanuit vrijwel elk bestandstype, en een open-source licentie. Dat maakt het de moeite waard om er even bij stil te staan.
Wat Wan 3.0 precies doet
Wan 3.0 is een AI-model dat video genereert op basis van verschillende soorten input. Je geeft het een tekst, een afbeelding, een audiofragment of een combinatie daarvan — en het model maakt daar een videoclip van. Volgens de aankondiging gaat het om clips tot 30 seconden, wat opvallend lang is voor dit soort modellen. Ter vergelijking: veel concurrenten zitten nog op 5 tot 15 seconden per generatie.
Wat mij hier opvalt is de zogenaamde "Omni-Reference"-functie. Waar eerdere modellen vooral werkten met tekst en afbeeldingen, accepteert Wan 3.0 volgens Alibaba ook documenten, spreadsheets, presentaties en webpagina's als input. Stel dat je als ondernemer een productsheet hebt en daar een korte video van wilt laten maken — dat is het soort scenario dat hiermee mogelijk wordt. Of dat in de praktijk al soepel werkt, moet de bèta uitwijzen.
Technisch draait het model op een zogeheten Mixture-of-Experts architectuur met 27 miljard parameters, waarvan er 14 miljard actief zijn per keer dat je het gebruikt. Dat is een techniek waarbij het model niet al zijn rekenkracht tegelijk inzet, maar alleen de relevante onderdelen activeert — een beetje zoals een bedrijf dat niet elke afdeling inschakelt voor elke klantvraag, maar alleen de specialisten die nodig zijn.
Open source: wat dat concreet betekent
Het meest interessante aan Wan 3.0 voor ondernemers is misschien niet de technologie zelf, maar de licentie. Het model wordt uitgebracht onder Apache 2.0, een open-source licentie die commercieel gebruik toestaat zonder licentiekosten. Je mag het model downloaden, aanpassen en in je eigen producten of processen gebruiken.
Ik vind dit eerlijk gezegd een opvallende keuze. De meeste grote AI-videomodellen — denk aan OpenAI's Sora 2, Google's Veo 3.1 of Runway Gen-4 — werken met een abonnementsmodel. Je betaalt per maand of per gegenereerde seconde video. Bij Wan 3.0 kun je in principe het model zelf draaien, op eigen hardware of via een cloudprovider.
Nu moet ik daar meteen een kanttekening bij plaatsen. "Gratis" is relatief. Volgens een kostenanalyse van Flowith kost het zelf hosten van Wan 3.0 bij matig gebruik (zo'n 100 video's per maand) ongeveer 300 euro aan stroom, plus een eenmalige hardware-investering van rond de 1.600 euro. Via een cloudprovider zit je op 360 tot 960 euro per jaar. Ter vergelijking: een Sora 2-abonnement kost bij datzelfde gebruik zo'n 240 euro per jaar, Runway ongeveer 144 euro. Zelf hosten wordt dus pas na ongeveer een jaar kosteneffectief — en dan moet je ook de technische kennis in huis hebben om dat op te zetten.
Wat betekent dat voor een MKB-ondernemer?
Als je geen technisch team hebt, is zelf hosten waarschijnlijk geen realistisch startpunt. Maar de open licentie heeft ook indirecte voordelen: het zorgt ervoor dat derde partijen — denk aan Nederlandse SaaS-platforms, marketingtools of videobewerkingssoftware — Wan 3.0 kunnen inbouwen in hun producten. Dat kan op termijn betekenen dat je via je bestaande tools toegang krijgt tot deze technologie, zonder dat je er zelf iets voor hoeft op te zetten.
Hoe verhoudt het zich tot de concurrentie?
De markt voor AI-videogeneratie is in 2026 behoorlijk druk. Volgens vergelijkingen van onder meer Tech Insider en Lushbinary vormen Google's Veo 3.1, Kling 3.0 en OpenAI's Sora 2 de huidige top. Wan 3.0 wordt gepositioneerd als een serieuze concurrent, maar met een ander profiel.
Qua visuele kwaliteit scoort Wan 3.0 volgens vroege tests een 8,5 op 10 — goed, maar net iets onder de gepolijste output van Sora 2. Waar het model volgens diezelfde tests uitblinkt is in prompt-navolging: het doet beter dan gemiddeld precies wat je vraagt qua camerahoek, sfeer en compositie. Dat klinkt als een detail, maar als je een video wilt die specifiek past bij jouw merk of product, is dat juist relevant.
Wat ik interessant vind: Kling 3.0 wordt in meerdere vergelijkingen genoemd als de beste prijs-kwaliteitverhouding voor de meeste gebruikers, met kosten van ongeveer 0,84 euro voor een clip van tien seconden inclusief audio. Wan 3.0 concurreert niet direct op prijs via een platform, maar op flexibiliteit — het feit dat je het model zelf kunt draaien en aanpassen.
De Omni-Reference-functie: veelbelovend maar onbewezen
De claim dat Wan 3.0 niet alleen tekst en afbeeldingen, maar ook spreadsheets, presentaties en webpagina's als input accepteert, is wat mij betreft het meest nieuwsgierig makende onderdeel. Kun je je voorstellen wat dit zou betekenen als je bijvoorbeeld een kwartaalrapport hebt en daar in een paar minuten een samenvatting-video van kunt laten genereren voor je team of je klanten?
Ik moet hier wel eerlijk zijn: op dit moment heb ik geen onafhankelijke tests of reviews gevonden die deze functie in de praktijk bevestigen. De publieke bèta is net live, dus het is mogelijk dat de functionaliteit nog beperkt werkt of dat de kwaliteit van de output bij complexe documenten tegenvalt. Ik zou dit willen labelen als "veelbelovend maar onbewezen" — precies het soort claim dat je pas serieus kunt nemen als er praktijkervaring mee is.
Wat nog onduidelijk is
Er zijn een paar punten waar ik geen helder antwoord op heb gevonden. Ten eerste: de exacte beschikbaarheid. De tweet spreekt van een publieke bèta waar je je voor kunt aanmelden, maar het is onduidelijk of die wereldwijd beschikbaar is of alleen in bepaalde regio's. Ten tweede: de vraag of het volledige model — alle gewichten — ook daadwerkelijk al beschikbaar is om te downloaden. Volgens een overzicht op Wan27.org waren de gepubliceerde gewichten op het moment van schrijven nog beperkt tot eerdere versies.
Dat is geen ongebruikelijk patroon — bedrijven lanceren vaker een bèta via een platform terwijl de downloadbare versie later volgt — maar het is goed om te weten als je overweegt om er nu al mee aan de slag te gaan.
Een markt in beweging
Wat ik vooral meeneem uit deze aankondiging is niet zozeer het model zelf, maar het tempo. In de afgelopen twee weken zijn er meerdere grote AI-videomodellen gelanceerd of geüpdatet: Hailuo 3 eind juli, FLUX 3 begin augustus, en nu Wan 3.0. Voor ondernemers die nadenken over video in hun communicatie is dat relevant, omdat het betekent dat de kwaliteit omhooggaat terwijl de kosten en de instapdrempel dalen.
Voor mij is dit vooral een signaal dat AI-gegenereerde video snel verschuift van "speeltje voor techliefhebbers" naar een instrument dat ook voor kleinere bedrijven bereikbaar wordt. Of Wan 3.0 daarin het juiste model is voor jouw situatie, hangt af van je technische mogelijkheden en je bereidheid om met een bèta te experimenteren. Maar dat de optie er nu is — open, zonder licentiekosten, met steeds langere en betere output — dat vind ik op zichzelf een ontwikkeling die de moeite waard is om te volgen.
80% van de AI-projecten haalt productie nooit.
Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.