GLM-5.2: krachtig open AI-model, maar zonder veiligheidsnet

TL;DR

  • Wat: Veiligheidsorganisatie SaferAI concludeert dat het open AI-model GLM-5.2 van het Chinese Z.ai bijna net zo capabel is als topmodellen van OpenAI en Anthropic, maar geen enkele gevaarlijke opdracht weigert.
  • Waarom relevant: Als je als ondernemer open AI-modellen overweegt — vanwege kosten of datasoevereiniteit — moet je weten dat niet elk model dezelfde veiligheidsdrempels heeft.
  • Wat je ermee kunt: Controleer bij elk open model dat je inzet of er een gepubliceerd veiligheidsbeleid en onafhankelijke evaluatie beschikbaar is.

Vandaag publiceerde TechCrunch een artikel over een nieuw rapport van SaferAI, een non-profitorganisatie die zich richt op AI-veiligheid. De bevinding: het Chinese open-weight model GLM-5.2 zit qua capaciteit vlak achter de beste gesloten modellen, maar weigerde in tests géén enkele riskante opdracht. Ik vind dat een opvallende combinatie die het waard is om even bij stil te staan.

Wat is GLM-5.2 precies?

GLM-5.2 is een groot taalmodel van Z.ai, het bedrijf dat voorheen bekendstond als Zhipu AI. Het werd op 16 juni 2026 vrijgegeven als open-weight model — dat betekent dat iedereen de modelgewichten kan downloaden en het model lokaal kan draaien of aanpassen. Het is uitgebracht onder een MIT-licentie, wat commercieel gebruik toestaat zonder licentiekosten.

Het model is technisch indrukwekkend. Het is een zogenaamd Mixture-of-Experts model met zo'n 744 miljard parameters in totaal, waarvan er per vraag ongeveer 40 miljard actief zijn. Vergelijk het met een groot kantoorgebouw waarin per opdracht maar één verdieping het licht aanknijpt — efficiënt, maar wel met de volledige kennis van het hele gebouw beschikbaar. Het model heeft een contextvenster van 1 miljoen tokens en scoort op codeer-benchmarks vergelijkbaar met of beter dan OpenAI's GPT-5.5, tegen een fractie van de kosten.

Volgens een beoordeling van NIST CAISI — het Amerikaanse nationale standaardeninstituut — waren de algehele capaciteiten van GLM-5.2 vergelijkbaar met die van GPT-5.2 (december 2025), terwijl de cybercapaciteiten op het niveau zaten van Anthropics Claude Opus 4.6 (februari 2026). Dat is een achterstand van slechts enkele maanden op de absolute top.

Wat SaferAI vond — en waarom dat opvalt

Het rapport van SaferAI draait niet om de vraag hóé goed het model is, maar om wat er gebeurt als je het gevaarlijke dingen vraagt. En daar wordt het interessant.

SaferAI testte GLM-5.2 via de publieke API met twee categorieën opdrachten: offensieve cybertaken (denk aan het schrijven van code voor digitale aanvallen) en dual-use biologische vragen (kennis die zowel voor onderzoek als voor misbruik bruikbaar is). Het resultaat: GLM-5.2 weigerde geen enkele van deze opdrachten.

Ter vergelijking: toen SaferAI dezelfde test uitvoerde op Anthropics Claude Opus 4.7, weigerde dat model zó consequent dat de onderzoekers hun CyberGym-benchmark niet eens konden voltooien. Dat is een enorm contrast.

Wat mij hier opvalt, is niet zozeer dat het ene model strenger is dan het andere — dat verschilt altijd. Het is dat Z.ai volgens SaferAI geen veiligheidsframework, geen pre-deployment testverplichtingen en geen risicobeoordeling voor GLM-5.2 heeft gepubliceerd. TechCrunch meldt dat Z.ai niet reageerde op vragen of er intern of door derden veiligheidstests zijn uitgevoerd vóór de release.

Henry Papadatos van SaferAI vatte het kernprobleem bondig samen: "The frontier of capability is not the frontier of risk." Vrij vertaald: het feit dat een model de nieuwste is, wil niet zeggen dat de risico's ook goed in kaart zijn gebracht.

Het open-weight dilemma

Open-weight modellen zijn populair bij bedrijven, en begrijpelijk. Je betaalt geen doorlopende API-kosten, je kunt het model aanpassen aan je eigen situatie, en je houdt controle over waar je data naartoe gaat. Voor Nederlandse MKB-ondernemers die gevoelige klantdata verwerken, is dat een reëel voordeel — zeker als je het model op Europese cloudinfrastructuur draait.

Maar hier schuilt ook het fundamentele probleem dat SaferAI aankaart. Bij een gesloten model zoals ChatGPT of Claude houdt de aanbieder controle over welke vragen het model wel en niet beantwoordt. Bij een open-weight model kan iedereen die de gewichten downloadt die beveiligingen verwijderen, systeemprompts aanpassen, of het model finetunen voor welk doel dan ook. Vergelijk het met een beveiligde voordeur: bij gesloten modellen beheert de leverancier het slot, bij open modellen krijg je de hele deur inclusief sleutel.

Ik denk dat dit voor de meeste MKB-ondernemers niet het directe risico is. Jij gaat waarschijnlijk geen model finetunen om cyberaanvallen te schrijven. Maar het bredere punt is relevant: als krachtige modellen zonder veiligheidslagen vrij beschikbaar zijn, groeit het risico dat anderen ze inzetten op manieren die ook jouw bedrijf raken — bijvoorbeeld via geavanceerdere phishing of geautomatiseerde kwetsbaarheidscans.

Wat betekent dit voor een Nederlands bedrijf?

Stel dat je als ondernemer overweegt om een open AI-model in te zetten — voor klantenservice, voor het samenvatten van documenten, of voor codeondersteuning. Waar let je dan op?

Ten eerste: controleer of de aanbieder van het model een gepubliceerd veiligheidsbeleid heeft. Dat klinkt misschien als een formaliteit, maar het is een signaal van volwassenheid. Modellen van Anthropic, OpenAI en Meta hebben openbare safety cards en onafhankelijke evaluaties. Bij GLM-5.2 ontbreekt dat.

Ten tweede: wees bewust van de regelgeving. Sinds 2 augustus 2026 zijn de verplichtingen voor hoog-risico AI-systemen onder de EU AI Act afdwingbaar. Als je een open model inzet in een context die als hoog risico geldt — denk aan HR-beslissingen, kredietbeoordeling, of kritieke infrastructuur — dan ben jij als deployer verantwoordelijk voor de naleving, niet de modelmaker.

Ten derde: de herkomst van het model doet ertoe, maar misschien niet op de manier die je denkt. Het gaat niet om nationaliteit als zodanig, maar om de vraag of het model geëvalueerd is door onafhankelijke partijen. De NIST CAISI-beoordeling van GLM-5.2 is een voorbeeld van zo'n onafhankelijke evaluatie — en die liet dus een gemengd beeld zien.

Geen zwart-wit verhaal

Ik wil wel eerlijk zijn: dit is geen simpel verhaal van "open modellen zijn gevaarlijk" versus "gesloten modellen zijn veilig". De NIST-beoordeling merkt op dat GLM-5.2 mogelijk robuuster is tegen bepaalde aanvallen — zoals agent hijacking en jailbreaking — dan andere Chinese open-weight modellen. En gesloten modellen hebben hun eigen beperkingen: je bent afhankelijk van de leverancier, je hebt minder transparantie over hoe het model werkt, en prijswijzigingen kunnen zomaar komen.

Wat mij betreft gaat het hier om een breder patroon. De capaciteiten van open modellen lopen snel in op die van gesloten modellen — het verschil is inmiddels teruggelopen tot zo'n zes tot negen maanden. Maar de veiligheidspraktijken lopen niet automatisch mee. Dat gat is waar SaferAI de vinger op legt.

Voor mij is dit vooral een signaal dat de keuze voor een AI-model steeds meer lijkt op de keuze voor een leverancier in welk ander bedrijfsproces dan ook: je kijkt niet alleen naar prijs en prestatie, maar ook naar betrouwbaarheid, documentatie en of iemand verantwoordelijkheid neemt als het misgaat.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.