OpenAI toont vogelherkenning met GPT-Live en Codex

TL;DR

  • Wat: OpenAI deelde een demo van een vogelherkennings-app, gebouwd met GPT-Live (real-time spraak-AI) en Codex (de coding-agent).
  • Waarom relevant: Het laat zien hoe snel je met AI-bouwstenen een werkend prototype kunt maken dat camera en spraak combineert — een patroon dat ver voorbij vogels gaat.
  • Wat je ermee kunt: Bedenk welk herkennings- of identificatieprobleem in jouw bedrijf baat zou hebben bij real-time beeld plus gesproken uitleg.

Ik scrollde door X en zag een tweet van het officiële ChatGPT-account: een demo van een "birdwatching buddy", gebouwd met GPT-Live en Codex, die vogels om je heen herkent via je camera en er in real-time over vertelt. Niet het soort bericht waar je als ondernemer direct bij stilstaat — totdat je doorhebt welk patroon erachter zit.

Wat is hier precies gebouwd?

De demo toont een app die twee recente OpenAI-technologieën combineert:

  • GPT-Live — gelanceerd op 8 juli 2026 — is OpenAI's nieuwe generatie spraakmodellen. Het bijzondere: ze werken full-duplex. Dat betekent dat het model tegelijkertijd kan luisteren en spreken, zoals in een echt telefoongesprek. Je kunt het onderbreken, tussendoor een vraag stellen, of hardop nadenken zonder dat het systeem in de war raakt.
  • Codex — OpenAI's coding-agent — is sinds 23 juli 2026 gekoppeld aan ChatGPT Voice op de desktop-app. Je kunt Codex via spraak aansturen om code te schrijven, aan te passen of te draaien.

Samen vormen ze de basis van deze vogelherkenner: je richt je camera op een vogel, de app "ziet" wat je ziet, en vertelt je via spraak welke soort het is. Geen getypte prompt, geen wachttijd — gewoon kijken en luisteren.

Wat mij hier opvalt, is niet zozeer de vogelherkenning zelf. Apps als Merlin Bird ID van Cornell Lab doen dat al jaren, met meer dan 12,5 miljoen downloads en een nauwkeurigheid van zo'n 85 procent voor Noord-Amerikaanse soorten. Wat wél nieuw is, is de manier waarop dit prototype tot stand kwam: door twee AI-bouwstenen aan elkaar te knopen, zonder traditioneel softwareontwikkeltraject.

Waarom dit patroon interessanter is dan de vogel

Laat ik eerlijk zijn: de meeste ondernemers die ik ken, liggen niet wakker van vogelherkenning. Maar vervang "vogel" door iets uit jouw vakgebied en het wordt een ander verhaal.

Het patroon is: camera + real-time herkenning + gesproken uitleg.

Stel dat je als ondernemer een groothandel in bouwmaterialen runt. Een medewerker op de bouwplaats richt de camera op een product en krijgt direct te horen wat het is, wat de specificaties zijn, en of het op voorraad ligt. Of stel dat je een kwekerij hebt: een klant houdt een plant voor de camera en krijgt gesproken advies over verzorging en standplaats.

Dit zijn geen sciencefiction-scenario's meer. De bouwstenen — real-time beeld verwerken, spraak genereren, en die twee combineren — zijn beschikbaar. Het vogelvoorbeeld is een demonstratie van wat er technisch kan. De zakelijke invulling is aan jou.

Wat GPT-Live anders maakt dan eerdere spraak-AI

Ik vind het eerlijk gezegd fascinerend hoe snel spraakinteractie met AI is geëvolueerd. Nog geen jaar geleden was "praten met ChatGPT" een ervaring met duidelijke beurtwisselingen: jij praat, het model denkt, het model antwoordt. Nu werkt GPT-Live full-duplex — het luistert terwijl het spreekt.

Volgens VentureBeat kun je het model halverwege een zin onderbreken, een bijvraag stellen, of van onderwerp wisselen — precies zoals je dat in een normaal gesprek zou doen. Het model past zich direct aan.

Voor zakelijk gebruik maakt dat een groot verschil. Denk aan een monteur die met beide handen bezig is en tussendoor vragen stelt aan een AI-assistent. Of een magazijnmedewerker die hardop inventariseert terwijl het systeem meeluistert en registreert. De drempel om AI te gebruiken daalt enorm als je er gewoon tegenaan kunt praten.

Wel een kanttekening

Belangrijk om te weten: GPT-Live op de desktop is vooralsnog een product, geen API die je in je eigen software kunt inbouwen. Volgens meerdere bronnen is er nog geen publieke API waarmee ontwikkelaars GPT-Live rechtstreeks in eigen applicaties kunnen integreren. Wie nu een eigen voice-AI-oplossing wil bouwen, gebruikt de bestaande Realtime API van OpenAI — dat is een ander pad. Ik zou hier dus voorzichtig zijn met de verwachting dat je dit morgen in je eigen app hebt draaien.

Wat betekent dit voor de Nederlandse ondernemer?

Kun je je voorstellen wat dit patroon betekent als je het toepast op klantenservice? Op productherkenning in een webshop? Op kwaliteitscontrole in een productieomgeving?

Ik denk dat de praktische relevantie voor MKB-ondernemers in twee dingen zit:

  1. De drempel om prototypes te bouwen daalt. Als OpenAI zelf een werkende vogelherkenner kan demonstreren die is gebouwd met hun eigen tools, dan verschuift het gesprek van "we hebben een ontwikkelteam nodig" naar "we hebben een goed idee nodig". Dat is een ander startpunt.

  2. Multimodale AI wordt de norm. Tekst alleen is niet meer genoeg. De combinatie van beeld, spraak en tekst in één interactie — dat is waar AI-toepassingen naartoe bewegen. Als je nu nadenkt over hoe AI in jouw bedrijf past, denk dan niet alleen aan chatbots die tekst verwerken. Denk aan systemen die zien, horen en spreken.

Dat gezegd hebbende: dit is een demo, geen kant-en-klaar product. De stap van "kijk, het werkt" naar "dit draait betrouwbaar in mijn bedrijf" is er nog steeds eentje die tijd, testen en vaak ook budget kost.

Een demo als signaal

Ik zou willen dat ik kon zeggen dat elke ondernemer morgen een vogelherkenner-achtige tool voor het eigen bedrijf kan bouwen. Zo ver is het nog niet. Maar wat mij betreft is deze demo vooral een signaal: de technologische bouwstenen voor real-time, multimodale AI-toepassingen zijn er. Ze zijn niet meer voorbehouden aan grote techbedrijven met eigen onderzoekslabs.

Voor mij is dit vooral een moment om even stil te staan bij hoe snel deze ontwikkeling gaat — en om na te denken over welk probleem in jouw bedrijf gebaat zou zijn bij een systeem dat kan kijken, luisteren en antwoorden. Niet over een jaar. Nu.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.