Google lanceert Gemini 3.6 Flash en Flash-Lite: sneller en goedkoper

Google lanceert Gemini 3.6 Flash en Flash-Lite: sneller en goedkoper

TL;DR

  • Wat: Google brengt twee nieuwe AI-modellen uit — Gemini 3.6 Flash en 3.5 Flash-Lite — gericht op lagere kosten en betere prestaties voor zakelijke AI-toepassingen.
  • Waarom relevant: De API-prijzen dalen flink, waardoor AI-automatisering voor meer bedrijven financieel haalbaar wordt.
  • Wat je ermee kunt: Bekijk of je huidige AI-kosten omlaag kunnen door naar een van deze modellen over te stappen.

Gisteren kondigde Google twee nieuwe Gemini-modellen aan: Gemini 3.6 Flash en Gemini 3.5 Flash-Lite. Ik viel erover omdat het verhaal dit keer niet gaat over "het slimste model ooit", maar over efficiëntie en kosten — en dat is precies waar het voor ondernemers interessant wordt.

Wat is er precies gelanceerd?

Google heeft twee modellen tegelijk uitgebracht, elk met een eigen rol:

Gemini 3.6 Flash is de opvolger van 3.5 Flash — het werkpaard van Google's AI-aanbod. Het model scoort beter op programmeertaken (49% op DeepSWE, tegenover 37% bij de voorganger), kenniswerk en zogenaamd "computer use" — dat is wanneer een AI zelfstandig een scherm bedient, zoals klikken, typen en navigeren.

Maar wat mij het meest opvalt: het model verbruikt 17% minder output-tokens dan zijn voorganger om dezelfde taak af te ronden. Tokens zijn de eenheden waarin AI-modellen tekst verwerken — je betaalt per token, dus minder tokens betekent een lagere rekening. Op gespecialiseerde taken loopt die besparing zelfs op tot 65%.

Gemini 3.5 Flash-Lite is het budgetmodel. Met een prijs van $0,30 per miljoen input-tokens en $2,50 per miljoen output-tokens is dit een van de goedkoopste modellen op de markt. Het draait 350 tokens per seconde uit — dat is snel genoeg voor toepassingen waarbij je veel verzoeken tegelijk verwerkt, zoals het doorzoeken van grote hoeveelheden documenten.

Daarnaast lanceerde Google nog een derde model — Gemini 3.5 Flash Cyber — maar dat is specifiek voor cybersecurity en alleen beschikbaar voor overheden. Voor de meeste ondernemers is dat (voorlopig) niet relevant.

De prijzen in perspectief

Laat me de kosten even naast elkaar zetten, want daar zit het verhaal:

Model Input (per 1M tokens) Output (per 1M tokens)
Gemini 3.5 Flash (vorige generatie) $1,50 $9,00
Gemini 3.6 Flash $1,50 $7,50
Gemini 3.5 Flash-Lite $0,30 $2,50

De outputprijs van 3.6 Flash daalt dus van $9 naar $7,50 per miljoen tokens. Dat klinkt misschien als klein bier, maar als je dat combineert met het feit dat het model ook nog eens 17% minder tokens nodig heeft, dan tel je twee besparingen bij elkaar op. Stel dat je als ondernemer een klantenservice-bot draait die dagelijks duizenden vragen beantwoordt — dan merk je dat verschil op je maandrekening.

Flash-Lite is nog een stuk goedkoper, maar daar lever je iets van de geavanceerde mogelijkheden voor in. Voor eenvoudigere taken — denk aan het samenvatten van documenten of het categoriseren van e-mails — kan dat prima volstaan.

Waarom dit voor ondernemers interessant is

Ik vind het eerlijk gezegd opvallend dat Google hier niet de nadruk legt op "het slimste model", maar op "het efficiëntste model". Dat zegt iets over waar de markt naartoe beweegt.

Voor veel MKB-bedrijven die met AI experimenteren, is de vraag niet: "Kan AI dit?" — die vraag is inmiddels vaak beantwoord. De vraag is: "Kan ik dit betalen op schaal?" En daar komen modellen als Flash-Lite in beeld.

Agents worden betaalbaarder

Beide modellen zijn expliciet ontworpen voor wat Google "agentic workflows" noemt — AI die niet alleen een vraag beantwoordt, maar zelfstandig stappen uitvoert. Denk aan een AI-agent die een klantvraag ontvangt, het juiste document opzoekt, de relevante passage eruit haalt en een conceptantwoord opstelt. Elke stap kost tokens, en bij een goedkoper model dalen die kosten per stap.

Kun je je voorstellen wat dat betekent als je een webshop runt en dagelijks honderden klantvragen verwerkt? Of als je een administratiekantoor hebt dat facturen en documenten classificeert?

De kennisdatum is eindelijk bijgewerkt

Een detail dat makkelijk over het hoofd te zien is: de kennisdatum van Gemini 3.6 Flash is opgeschoven van januari 2025 naar maart 2026. Dat klinkt technisch, maar het betekent dat het model nu weet wat er het afgelopen jaar in de wereld is gebeurd. Als je het model vragen stelt over recente regelgeving, markttrends of producten, krijg je relevantere antwoorden.

Wat zegt dit over de AI-markt?

Ik denk dat deze lancering past in een bredere trend. OpenAI, Anthropic en Google concurreren steeds minder op "wie heeft het slimste model" en steeds meer op "wie levert de beste prijs-kwaliteitverhouding". Dat is logisch: voor de meeste zakelijke toepassingen heb je geen topmodel nodig — je hebt een betrouwbaar, snel en betaalbaar model nodig.

Google hintte overigens ook op Gemini 4, dat zich in de pre-trainingsfase bevindt. Daar is verder nog niets concreets over bekend, maar het geeft aan dat het bedrijf op meerdere fronten tegelijk bouwt.

Wat mij betreft is er ook een kanttekening: Gemini 3.5 Pro — het topmodel van Google — is nog steeds niet breed beschikbaar. Het wordt getest met partners, maar een brede lancering laat op zich wachten. Voor ondernemers die het beste van het beste willen, is dat voorlopig geen optie.

Een signaal over waar de waarde zit

Voor mij is deze lancering vooral een bevestiging dat de echte wedstrijd in AI verschuift van ruwe intelligentie naar praktische inzetbaarheid. Goedkoper, zuiniger, sneller — dat zijn de woorden die er nu toe doen. En dat is precies het moment waarop AI voor meer ondernemers bereikbaar wordt dan alleen de early adopters met diepe zakken.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.