AI-tools
Google laat AI-stemmen zelf ontwerpen en regisseren, met watermerk tegen misbruik
Google's nieuwe Gemini 3.8-modellen ontwerpen en regisseren realistische AI-stemmen in meer dan 100 talen, met een onzichtbaar watermerk tegen misbruik.
Op basis van Google DeepMind en Techmeme
Samengesteld met AI-assistentie uit de onderstaande bronnen, onder redactie van Frederiek Pascal. Hoe dit werkt
In het kort
- Google lanceert Gemini 3.8 Flash TTS en Flash-Lite TTS, twee modellen die spraak genereren en regisseren met controle over toon, tempo en emotie.
- Je kunt een volledig nieuwe stem laten ontwerpen met een tekstprompt, of je eigen stem klonen met een opname van dertig seconden en expliciete toestemming.
- De modellen ondersteunen meer dan honderd talen en dialecten en zijn nu beschikbaar via Google AI Studio en de Gemini API.
- Stemkloning via AI Studio is voorlopig niet beschikbaar in de Europese Economische Ruimte, wat de directe toegang voor Vlaamse gebruikers beperkt.
- Elk gegenereerd audiofragment krijgt een onzichtbaar watermerk (SynthID) zodat AI-stemmen achteraf herkenbaar blijven.
Google heeft twee nieuwe spraakmodellen uitgebracht waarmee je zelf een AI-stem kunt ontwerpen of je eigen stem laat klonen, en waarmee je die stem vervolgens tot in detail kunt regisseren: toon, tempo, emotie, zelfs zuchten of lachen. De modellen heten Gemini 3.8 Flash TTS en Gemini 3.8 Flash-Lite TTS en zijn vanaf nu te gebruiken via Google AI Studio, de Gemini API en stap voor stap ook in producten als Google Vids en Gemini Notebook.
Het grote verschil met bestaande tekst-naar-spraaktools is de mate van controle. Waar je vroeger kon kiezen uit een lijst met kant-en-klare stemmen, kun je nu met een gewone taalinstructie een volledig nieuwe stem laten ontstaan, bijvoorbeeld een joviale radiopresentator of een sobere klantenservicemedewerker. Volgens Google zijn er meer dan tweeduizend kant-en-klare stemmen beschikbaar, met regionale varianten zoals Mexicaans-Spaans of Quebecs Frans. Daarnaast kun je met een audiofragment van dertig seconden een bestaande stem, bijvoorbeeld je eigen stem of die van iemand die daar toestemming voor gaf, laten klonen.
Wat kan je hiermee als ondernemer?
Het antwoord ligt vooral in schaal en spreektaal. Bedrijven die podcasts, audioboeken, video’s of telefonische klantenservice maken, kunnen met deze modellen een consistente ‘merkstem’ opzetten die in meerdere talen dezelfde herkenbare klank behoudt. Google noemt zelf voorbeelden als nasynchronisatie van video’s, spraakassistenten en interactieve verhalen. Voor een Vlaamse kmo die bijvoorbeeld productvideo’s naar meerdere taalmarkten wil vertalen, kan dit het proces van dure studio-opnames vervangen door een script dat automatisch wordt ingesproken en geregisseerd.
De modellen ondersteunen naar eigen zeggen meer dan honderd talen en dialecten. In blinde tests op het platform Voice Arena zouden de modellen goed scoren in onder meer Japans, Braziliaans Portugees, Vietnamees, Arabisch, Mexicaans Spaans en Hindi. Nederlands wordt niet apart genoemd in het bronmateriaal, dus hoe goed de kwaliteit in het Nederlands of Vlaams is, blijft onduidelijk.
Is stemkloning zomaar toegestaan?
Niet zonder toestemming. Google bouwde expliciete controles in: wie een stem wil klonen, moet een gesproken toestemmingsverklaring van de stemhouder aanleveren die overeenkomt met het referentiegeluid. Dat is bedoeld om misbruik, zoals het nabouwen van iemands stem zonder medeweten, te voorkomen. Elk gegenereerd audiofragment krijgt bovendien een onzichtbaar digitaal watermerk, SynthID genoemd, en een herkomstlabel volgens de C2PA-standaard, zodat AI-gegenereerde spraak achteraf herkenbaar blijft.
Belangrijk detail: stemkloning via Google AI Studio is voorlopig niet beschikbaar in de Europese Economische Ruimte, waar Vlaanderen onder valt, net als in het Verenigd Koninkrijk, Zwitserland, en de Amerikaanse staten Illinois en Texas. Waarom die regio’s uitgesloten zijn, staat niet in de bronnen, maar het wijst mogelijk op lopende juridische afstemming rond privacy- en biometrische regels. Wie in Vlaanderen dus zelf een stem wil klonen via deze route, botst voorlopig op een beperking.
Wat kost het en wanneer is het beschikbaar?
Over prijzen zegt Google niets concreets in het aangeleverde materiaal. Het bedrijf meldt enkel dat de modellen vanaf nu uitrollen: voor ontwikkelaars via de Gemini API en Google AI Studio, voor bedrijven binnenkort via Gemini Enterprise, en voor iedereen via Gemini Notebook en Google Vids. Wie exacte tarieven wil weten, zal dus zelf bij Google Cloud of de Gemini-documentatie moeten kijken; dit artikel kan daarover geen uitspraak doen omdat de bronnen het niet vermelden.
Hangt hier een groter verhaal achter?
De lancering komt op een moment dat Google DeepMind ook aan zijn volgende grote taalmodel werkt. Techmeme meldt, op basis van berichtgeving van The Information, dat DeepMind-topman Koray Kavukcuoglu zegt dat Gemini 4 zich in een vroege fase van na-training bevindt en mogelijk eerder dan het einde van het jaar verschijnt. Die informatie is niet verder onderbouwd in de beschikbare bron en gaat over een ander model dan de spraaktools uit dit artikel, maar het toont dat Google momenteel in hoog tempo nieuwe AI-onderdelen uitrolt.
Voor een ondernemer die vandaag met tekst-naar-spraak wil experimenteren, verandert dat weinig: de nieuwe TTS-modellen staan los van een toekomstige Gemini 4 en zijn nu al te proberen.
Wat betekent dit voor jou
Stemkloning vraagt toestemming, ook binnen de EU nog niet volledig
- Marketeers met video's of podcasts in meerdere talen Ze kunnen straks met één stemprofiel content nasynchroniseren in tientallen talen, wat dure studio-opnames per taalmarkt kan vervangen, al ontbreekt informatie over prijzen.
- Ondernemers die hun eigen stem willen klonen Ze botsen voorlopig op een beperking: stemkloning via Google AI Studio is nog niet beschikbaar binnen de Europese Economische Ruimte, dus dit werkt nu niet vanuit Vlaanderen.
- Bedrijven die AI-stemmen inzetten voor klanten Ze moeten rekening houden met het onzichtbare SynthID-watermerk op elk fragment: gegenereerde spraak blijft daardoor detecteerbaar, wat relevant is bij vragen over transparantie of consumentenbescherming.
Veelgestelde vragen
Kan ik als Vlaamse ondernemer nu al mijn eigen stem laten klonen met Gemini?
Niet via Google AI Studio: die functie is voorlopig uitgesloten in de Europese Economische Ruimte, waar Vlaanderen onder valt. Via de Gemini API zou het mogelijk kunnen zijn, maar de bronnen specificeren dat niet. Check dus zelf de actuele voorwaarden voordat je hiermee aan de slag gaat.″
Moet ik toestemming vragen om iemands stem te gebruiken?
Ja. Google verplicht een gesproken toestemmingsverklaring van de stemhouder die overeenkomt met het aangeleverde referentiegeluid, voordat een stem gekloond kan worden. Zonder die verklaring werkt de kloonfunctie niet. Dat is bedoeld om te voorkomen dat iemands stem zonder medeweten wordt nagemaakt en misbruikt.
Wat kost het gebruik van deze nieuwe spraakmodellen?
De bronnen vermelden geen prijzen. Google meldt enkel dat de modellen beschikbaar zijn via de Gemini API, Google AI Studio, en binnenkort Gemini Enterprise, zonder tarieven te noemen. Wie kosten wil kennen, moet de officiële Google Cloud-documentatie raadplegen; dit artikel kan daar op basis van het bronmateriaal geen uitspraak over doen.
Werkt dit ook goed in het Nederlands?
Dat is onduidelijk. Google noemt sterke prestaties in talen als Japans, Portugees, Vietnamees, Arabisch, Spaans en Hindi, maar het Nederlands of Vlaams wordt in het bronmateriaal niet apart vermeld. Je zal dit dus zelf moeten uittesten voordat je erop vertrouwt voor klantcommunicatie.
Hoe weet ik of een stem die ik hoor door AI is gemaakt?
Elk fragment dat met deze Gemini-modellen wordt gegenereerd, krijgt een onzichtbaar digitaal watermerk (SynthID) en een herkomstlabel volgens de C2PA-standaard. Die zijn niet hoorbaar, maar wel detecteerbaar met de juiste tools, wat moet helpen om misinformatie via nagemaakte stemmen tegen te gaan.
Is dit gerelateerd aan het nieuwe grote taalmodel Gemini 4?
Niet direct. Gemini 4 is een apart, groter taalmodel waarover DeepMind-topman Koray Kavukcuoglu zegt dat het zich in een vroege fase van ontwikkeling bevindt. De spraakmodellen uit dit artikel zijn nu al beschikbaar en staan los van die toekomstige release.
Bronnen
Volg Kunstbrein in Google
Zet Kunstbrein bij je voorkeursbronnen. Dan zie je het vaker bij het nieuws bovenaan je zoekresultaten en in de AI-antwoorden van Google.
Voeg toe als voorkeursbron (opent Google in een nieuw tabblad)