Onderzoekers traceren hoe Chinese AI leert van westerse modellen

TL;DR

  • Wat: Onderzoekers hebben een methode ontwikkeld om het verborgen denkproces van AI-modellen zichtbaar te maken — en vonden daarbij sterke aanwijzingen dat sommige Chinese AI-modellen zijn getraind op de output van Amerikaanse modellen zoals Claude, GPT en Gemini.
  • Waarom relevant: Als ondernemer gebruik je mogelijk AI-tools waarvan onduidelijk is welk model eronder draait en hoe dat model aan zijn kennis komt — dat raakt betrouwbaarheid en compliance.
  • Wat je ermee kunt: Vraag je AI-leverancier welk basismodel er onder hun product zit en waar dat model vandaan komt.

Ik stuitte op een artikel via WIRED dat me meteen aan het denken zette. Onderzoekers hebben een manier gevonden om het interne redeneerproces van grote AI-modellen — Claude, GPT en Gemini — zichtbaar te maken. Wat ze daarin aantroffen, wijst erop dat bepaalde Chinese AI-modellen mogelijk zijn getraind op de output van die westerse systemen. Ik vind dat een belangrijk signaal, ook als je als ondernemer denkt: "Wat heb ik daarmee te maken?"

Wat zijn reasoning traces en hoe maak je ze zichtbaar?

Een reasoning trace is eigenlijk het 'kladblaadje' van een AI-model: de tussenstappen die het systeem intern doorloopt voordat het een antwoord geeft. Normaal gesproken zie je die niet. Je stelt een vraag, je krijgt een antwoord, en wat er tussenin gebeurt blijft verborgen.

De onderzoekers analyseerden zogenaamde attention patterns en intermediate layer activations — vrij vertaald: ze keken welke 'neuronen' in het model in welke volgorde actief werden tijdens het beantwoorden van vragen. Daarmee konden ze het stapsgewijze denkproces reconstrueren, zelfs als het model niet expliciet gevraagd werd om zijn redenering uit te leggen.

Wat mij hier opvalt, is de vergelijking die de onderzoekers zelf trekken: het is alsof je twee leerlingen hebt die niet alleen hetzelfde antwoord geven op een proefwerk, maar ook exact dezelfde tussenstappen laten zien — inclusief dezelfde ongebruikelijke afkortingen. Dat wijst niet op toeval.

Wat is er precies gevonden?

De onderzoekers ontdekten dat bepaalde Chinese AI-modellen reasoning traces vertonen die opvallend veel lijken op die van hun Amerikaanse tegenhangers. Het gaat niet om vergelijkbare antwoorden — dat kan bij goede modellen vaker voorkomen — maar om bijna identieke redeneerstructuren. Dat patroon suggereert dat het ene model direct heeft geleerd van de output van het andere, in plaats van onafhankelijk getraind te zijn op ruwe data.

Dit past in een breder beeld. In februari 2026 maakte Anthropic, het bedrijf achter Claude, publiekelijk bekend dat drie Chinese AI-labs — DeepSeek, Moonshot AI en MiniMax — meer dan 24.000 frauduleuze accounts hadden aangemaakt. Via die accounts werden ruim 16 miljoen gesprekken met Claude gevoerd om het denkproces, de redeneercapaciteiten en het agentische gedrag van het model systematisch te kopiëren. MiniMax was volgens Anthropic verantwoordelijk voor zo'n 13 miljoen van die uitwisselingen.

Dit proces heet in de AI-wereld distillation: je laat een groot, duur model als 'leraar' fungeren en traint een kleiner, goedkoper 'leerling-model' op diens antwoorden. Op zich is dat een legitieme techniek — veel AI-ontwikkelaars passen het toe. Maar het wordt problematisch als het zonder toestemming gebeurt, op industriële schaal, en in strijd met de gebruiksvoorwaarden.

Waarom is dit relevant voor militaire toepassingen?

Wat ik eerlijk gezegd verontrustend vind, is de militaire dimensie. Uit onderzoek van de Jamestown Foundation blijkt dat Chinese onderzoekers verbonden aan onder meer het Chinese Volksbevrijdingsleger en de PLA Cyberspace Force actief werken aan het destilleren van westerse AI-modellen. Het doel: die capaciteiten inzetten voor surveillance, cyberoperaties en tactische besluitvorming.

De kern van het probleem: bij distillatie worden vaak de ingebouwde veiligheidsmaatregelen van het oorspronkelijke model niet meegenomen. Je krijgt dan een model dat net zo slim redeneert als Claude of GPT, maar zonder de vangrails die voorkomen dat het schadelijke instructies opvolgt.

Wat maakt dit anders dan gewone concurrentie?

Het verschil zit in de methode. Normaal gesproken investeer je als bedrijf honderden miljoenen in onderzoek, data en rekenkracht om een model te bouwen. Bij distillatie sla je dat proces over en kopieer je de uitkomst — vergelijk het met een concurrent die niet zelf een recept ontwikkelt, maar jouw gerecht proeft en het nauwkeurig namaakt. Legaal? Dat hangt af van de voorwaarden. Ethisch? Daarover lopen de meningen uiteen.

Wat betekent dit voor jou als ondernemer?

Kun je je voorstellen dat de AI-tool die jij dagelijks gebruikt voor klantenservice, tekstverwerking of data-analyse, onder de motorkap een model draait waarvan je niet precies weet waar het vandaan komt?

Dat klinkt misschien theoretisch, maar het is minder vergezocht dan je denkt. Steeds meer softwareleveranciers integreren AI-modellen in hun producten zonder expliciet te vermelden welk model eronder zit. Een leverancier kan zeggen dat alles "Europees gehost" is, terwijl het onderliggende model qua gewichten en trainingsdata uit een heel andere hoek komt.

Voor Nederlandse MKB-ondernemers zie ik drie concrete aandachtspunten:

1. Transparantie van je AI-keten

Vraag je leverancier welk basismodel er onder hun AI-product draait. Niet omdat Chinese modellen per definitie slecht zijn — sommige presteren uitstekend — maar omdat je wilt weten wat je gebruikt. Net zoals je bij voedingsmiddelen de herkomst wilt kennen.

2. De EU AI Act tikt door

Vanaf augustus 2026 gelden de belangrijkste verplichtingen van de EU AI Act. Die wet stelt eisen aan transparantie en risicobeoordeling. Als je AI inzet voor beslissingen die mensen raken — denk aan sollicitatieselectie, kredietbeoordeling of klantsegmentatie — moet je kunnen verantwoorden hoe die AI tot zijn conclusies komt. Een model waarvan de herkomst onduidelijk is, maakt die verantwoording lastiger.

3. Veiligheid van AI-gegenereerde output

Als een model via distillatie is gebouwd zonder de oorspronkelijke veiligheidslagen, kan het kwetsbaarder zijn voor misbruik. Uit onderzoek van ABN AMRO blijkt dat het MKB nog onvoldoende is voorbereid op nieuwe digitale risico's. Ik denk dat de herkomst van je AI-model daar onderdeel van is.

Geen simpel verhaal van goed en fout

Ik wil benadrukken dat dit geen zwart-witverhaal is. Distillatie is een gangbare techniek in de AI-wereld en op zichzelf niet verwerpelijk. Bovendien heeft Beijing volgens Hong Kong Free Press ook Amerikaanse bedrijven beschuldigd van het trainen op Chinese voorbeelden. De waarheid is waarschijnlijk dat kennis in de AI-wereld in alle richtingen stroomt — soms via legitieme wegen, soms niet.

Wat ik wel interessant vind aan dit onderzoek, is dat reasoning traces een nieuw soort vingerafdruk lijken te bieden. Als je kunt aantonen dat twee modellen niet alleen dezelfde antwoorden geven maar ook hetzelfde denkpad bewandelen, heb je een sterkere basis om te praten over herkomst en eigenaarschap.

Voor mij is dit vooral een signaal dat de vraag "welk AI-model gebruik ik eigenlijk?" steeds relevanter wordt. Niet als technische hobby, maar als ondernemersvraag — over betrouwbaarheid, compliance en bewuste keuzes in je digitale gereedschapskist.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.