Naar de hoofdinhoud
Kunstbrein, AI-nieuws met duiding
27 augustus 2026
Terug naar het nieuws

AI-tools

Google lanceert Gemini 3.5 Transcribe: spraakherkenning die fouten zelf opruimt

Gemini 3.5 Transcribe zet gesproken tekst sneller en nauwkeuriger om in geschreven tekst, en verschijnt stap voor stap in Google-apps en voor ontwikkelaars.

Op basis van Google DeepMind en Ars Technica

5 min lezen 2 bronnen

Samengesteld met AI-assistentie uit de onderstaande bronnen, onder redactie van Frederiek Pascal. Hoe dit werkt

In het kort

  • Gemini 3.5 Transcribe is Googles nieuwe spraakherkenningsmodel en vervangt het oudere Chirp 3.
  • Het model haalt volgens Google een foutpercentage van 4,0 procent bij live spraak en 2,6 procent bij opnames.
  • Ontwikkelaars kunnen het model nu al gebruiken via de Gemini API in Google AI Studio en het Gemini Enterprise Agent Platform.
  • Voor Vlaamse bedrijven verandert er voorlopig weinig: het model is nog niet breed beschikbaar en prijzen ontbreken in de aankondiging.
  • Consumenten merken het nu al in de Gemini-app op macOS en via de functie Rambler op bepaalde Android-toestellen.

Wat dit voor jou betekent

Google heeft een nieuw spraak-naar-tekstmodel aangekondigd: Gemini 3.5 Transcribe. Het model moet gesproken taal sneller en nauwkeuriger omzetten in geschreven tekst, en ruimt daarbij zelf stopwoorden als “euh” en versprekingen op. Het vervangt het oudere model Chirp 3 en duikt de komende maanden op in verschillende Google-producten, van de Gemini-app tot straks Chrome.

Wat is er precies nieuw?

Gemini 3.5 Transcribe doet meer dan alleen woorden herkennen. Het model probeert ook te begrijpen wat je bedoelt, en past de tekst daarop aan. Zeg je “laten we dinsdag afspreken, nee toch woensdag”, dan verschijnt enkel “woensdag” in de uiteindelijke tekst. Vulwoorden verdwijnen automatisch en de tekst wordt meteen opgemaakt in leesbare zinnen.

Het model kan ook specifieke vaktaal of eigennamen herkennen als je die vooraf opgeeft, wat handig is voor wie veel met jargon werkt, denk aan medische termen, productnamen of interne afkortingen. Daarnaast herkent het automatisch meer dan 85 talen en kan het in opgenomen gesprekken tot drie sprekers apart onderscheiden, met tijdstempels per woord.

Volgens metingen van het testplatform Artificial Analysis, die Google zelf aanhaalt, haalt het model een foutpercentage van 4,0 procent bij real-time spraak en 2,6 procent bij opgenomen audio. Op een aparte, bredere internationale taaltest die Google zelf uitvoerde, de zogeheten FLEURS-benchmark, komt het model uit op 5,50 procent fout bij live spraak en 5,04 procent fout bij opnames. Ter vergelijking: het vorige model Chirp 3 zat volgens Ars Technica op 7,32 procent bij live spraak. De vooruitgang is dus reëel, maar minder spectaculair dan Google’s eigen marketing rond snelheid laat uitschijnen: de tijd tot een definitieve transcriptie zou wel met 70 procent zijn verbeterd, wat vooral merkbaar is in toepassingen waar je meteen op de tekst moet kunnen reageren.

Waar kun je het al gebruiken?

Voorlopig vooral in een beperkt aantal Google-producten, en niet overal tegelijk. Op macOS krijgt de Gemini-app het model al, waardoor je met je stem bestanden kunt laten samenvatten, tekst kunt herschrijven of zelfs afbeeldingen kunt laten genereren terwijl je gewoon praat. Op Android zit het model achter de nieuwe Rambler-functie in het toetsenbord Gboard, die volgens Ars Technica voorlopig alleen werkt op de Pixel 11, met uitbreiding naar meer toestellen later dit jaar.

Ontwikkelaars kunnen het model nu al aanspreken via de Gemini API, zowel in Google AI Studio als in het Gemini Enterprise Agent Platform, om eigen toepassingen te bouwen: spraakassistenten, live ondertiteling of analyses van klantengesprekken achteraf. Ook in de programmeeromgeving Google Antigravity en bij het “vibe coden” van apps met je stem in AI Studio is het model al inzetbaar. Chrome volgt binnenkort, waarmee je straks in eender welk tekstveld op het web met je stem zou kunnen typen, van e-mails tot reacties.

Is dit iets voor jouw zaak?

Als je nu al met spraak-naar-tekst werkt, bijvoorbeeld om notulen te maken, klantgesprekken te loggen of ondertitels te genereren, dan is dit een technologie om in de gaten te houden. Minder tijd kwijt aan het manueel opkuisen van transcripties kan echt tijd schelen, zeker bij veel gesprekken of vergaderingen. Bedrijven als Vivo, Intellitek Health en Lingopal noemen in Google’s eigen aankondiging al positieve ervaringen met snelheid, nauwkeurigheid en taalondersteuning, al gaat het daarbij om partners van Google zelf en niet om onafhankelijk onderzoek.

Belangrijk is wel dat het model momenteel nog in “public preview” zit, wat betekent dat het nog getest wordt en dat functies en voorwaarden kunnen veranderen. De bronnen vermelden geen prijzen voor het gebruik via de Gemini API, en het is dus nog niet duidelijk wat de kost wordt voor bedrijven die het willen inbouwen in eigen software. Ook over beschikbaarheid in het Nederlands specifiek, of over ondersteuning in België, zeggen de bronnen niets concreets.

Wat betekent de snelheidswinst concreet?

Voor toepassingen waar je meteen op gesproken tekst moet reageren, zoals een telefonische klantendienst of een live chatbot die via spraak werkt, is de tijd tussen spreken en een bruikbare tekst cruciaal. Een snellere verwerking betekent minder wachttijd voor de gebruiker aan de andere kant van de lijn. Voor het gewoon uittypen van een vergadering achteraf speelt die snelheid een kleinere rol, daar telt vooral de nauwkeurigheid.

Wat betekent dit voor jou

Wat de aankondiging nog niet duidelijk maakt

  • Bedrijven met veel telefonisch klantcontact Snellere en zuiverdere transcripties kunnen tijd besparen bij het verwerken van klantgesprekken, maar zonder duidelijke prijzen is een concrete kosteninschatting nu nog niet te maken.
  • Wie klantgegevens via spraak verwerkt De bronnen zeggen niets over waar en hoe audio- of tekstdata verwerkt worden, dus wie gevoelige gesprekken wil transcriberen doet er goed aan dat expliciet bij Google na te vragen voor het model in te zetten.
  • Marketeers en kmo's zonder ontwikkelaars in dienst Voorlopig is het model vooral zichtbaar voor programmeurs en in een beperkt aantal consumentenapps, dus wachten tot bredere, kant-en-klare toepassingen verschijnen is nu de meest praktische keuze.

Veelgestelde vragen

Wat is Gemini 3.5 Transcribe precies?

Het is een nieuw spraakherkenningsmodel van Google dat gesproken taal omzet in geschreven tekst. Het model ruimt automatisch stopwoorden en versprekingen op en herkent meer dan 85 talen. Het vervangt het oudere model Chirp 3 en is bedoeld voor zowel consumenten, in apps zoals Gboard en de Gemini-app, als ontwikkelaars die eigen spraaktoepassingen bouwen.

Kan ik dit model nu al gebruiken in België?

De bronnen geven geen duidelijkheid over specifieke beschikbaarheid in Vlaanderen of Nederland. Wel is bekend dat de Rambler-functie op Android voorlopig alleen op de Pixel 11 werkt, en dat ontwikkelaars het model via de Gemini API kunnen aanspreken. Wie zeker wil zijn van toegang, checkt best zelf de actuele voorwaarden bij Google.

Wat kost het gebruik van Gemini 3.5 Transcribe?

De bronnen vermelden geen prijzen voor het gebruik van het model via de Gemini API of het Enterprise Agent Platform. Het is momenteel beschikbaar in een testfase, publieke preview genoemd, waarbij voorwaarden en tarieven later vastgelegd kunnen worden. Wie het wil inzetten, doet er goed aan de actuele voorwaarden bij Google zelf na te kijken.

Is dit model nauwkeuriger dan bestaande spraak-naar-tekstoplossingen?

Google meldt twee reeksen cijfers: via het testplatform Artificial Analysis komt het uit op 4,0 procent fout bij live spraak en 2,6 procent bij opnames, en op een aparte meertalige toets, de FLEURS-benchmark, op 5,50 en 5,04 procent. Beide lijken een vooruitgang tegenover het eigen oudere model Chirp 3. Een onafhankelijke vergelijking met concurrerende spraaktechnologie ontbreekt in de aangeleverde bronnen.

Verwerkt Google mijn spraakgegevens binnen Europa?

De bronnen zeggen hier niets concreets over. Voor bedrijven die klantgegevens verwerken via spraak is dit wel een terechte vraag om vooraf uit te klaren bij Google, zeker als het gaat om gevoelige gesprekken zoals klantendienst of medische toepassingen.

Bronnen

Deel dit artikel

Nieuwsbrief

Wil je dinsdag en vrijdag het belangrijkste AI-nieuws in je mailbox?

Een selectie met bij elk stuk de duiding: wat verandert dit voor jouw zaak?

Uitschrijven kan met één klik onderaan elke mail. Zie ook Privacy en cookies.