AI-tools
OpenAI brengt stemmodellen die tegelijk praten en luisteren, zodat onderbreken werkt
GPT-Live-1 en zijn kleinere broer kunnen spreken en luisteren op hetzelfde moment, waardoor een gesprek met onderbrekingen en beurtwisselingen natuurlijker verloopt.
Op basis van TechCrunch
Samengesteld met AI-assistentie uit de onderstaande bronnen, onder redactie van Frederiek Pascal. Hoe dit werkt
In het kort
- GPT-Live-1 en GPT-Live-1 mini kunnen spreken en luisteren op hetzelfde moment.
- Daardoor verlopen beurtwisselingen soepeler en kan je het model onderbreken zoals bij een mens.
- De kleinere versie vervangt standaard de bestaande geavanceerde spraakmodus in ChatGPT.
- Betalende gebruikers krijgen toegang tot het grotere model van de twee.
- Genoemde toepassingen zijn live vertalen, gesprekken van dertig tot veertig minuten en handenvrij werken.
Praten tegen een computer werkte tot nu als een walkietalkie: jij zegt iets, dan is de machine aan de beurt. OpenAI bracht twee modellen uit die dat doorbreken.
Tegelijk praten en luisteren
GPT-Live-1 en GPT-Live-1 mini werken in twee richtingen tegelijk. Ze spreken en luisteren op hetzelfde moment, en dat is de reden dat beurtwisselingen soepeler verlopen en dat je ertussen kan komen zonder dat het misloopt.
Dat klinkt als een detail, maar het is het verschil tussen een keuzemenu en een gesprek. Wie ooit tegen een spraakcomputer heeft geprobeerd te zeggen dat hij het verkeerd begrepen had, kent het probleem.
Wat ze nog kunnen
De modellen werken samen met nieuwere modellen voor zoeken en redeneren. Ze kunnen stil blijven terwijl ze meeluisteren om context op te nemen, en informatie ook visueel presenteren in plaats van alles uit te spreken.
De kleinere van de twee vervangt standaard de spraakmodus die er al was in ChatGPT. Wie betaalt, kan bij het grotere model.
De kanttekening
Live vertalen wordt als toepassing naar voren geschoven, maar de demonstratie was niet overtuigend: het Hindi klonk onnatuurlijk en droeg een zwaar Amerikaans accent. Er wordt gezegd dat er geoptimaliseerd is voor de meest gesproken talen, zonder dat duidelijk wordt welke dat zijn.
Dat is precies het soort belofte om zelf te toetsen. Nederlands is geen kleine taal, maar het is ook niet vanzelfsprekend dat het in dat rijtje zit.
Waar het interessant wordt
Gesprekken van dertig tot veertig minuten worden genoemd, net als werken zonder je handen te gebruiken bij ingewikkelder taken. Er wordt zelfs geopperd dat dit ooit in oordopjes kan belanden.
Voor een ondernemer met telefonisch klantcontact is dat de vraag die telt: is dit goed genoeg om iemand aan de lijn te houden zonder dat hij merkt dat hij tegen software praat, en zonder dat hij zich eraan ergert.
Wat betekent dit voor jou
Onderbreken kunnen is precies wat een telefoongesprek van een menu onderscheidt
- Wie klantcontact per telefoon heeft Een systeem dat je kan onderbreken zonder in de war te raken, is het verschil tussen een gesprek en een keuzemenu. Dat maakt spraak voor het eerst bruikbaar op plekken waar je vandaag nog een mens zet.
- Bedrijven met anderstalige klanten Live vertalen wordt genoemd als toepassing, maar bij de demonstratie klonk het Hindi onnatuurlijk en met een zwaar Amerikaans accent. Test dus zelf in de talen die jij nodig hebt voor je er iets op bouwt.
- Wie handenvrij wil werken Gesprekken van een half uur en langer worden als mogelijkheid genoemd. Voor werk waarbij je handen bezig zijn, van een werkplaats tot een wagen, is dat een andere manier van werken dan typen.
Veelgestelde vragen
Wat betekent spreken en luisteren tegelijk?
Tot nu wachtte een spraakassistent tot jij klaar was met praten voor hij begon. Deze modellen doen beide tegelijk, waardoor het gesprek meer op een echt gesprek lijkt: je kan ertussen komen, en het systeem raakt daar niet van in de war.
Welke twee modellen zijn er precies?
GPT-Live-1 is de grootste van de twee, met daarnaast GPT-Live-1 mini als lichtere variant. De kleine versie komt standaard in de plaats van de spraakmodus die er al was, en wie betaalt kan bij het grotere model.
Wat kunnen ze naast praten?
Ze schakelen nieuwere modellen in om op te zoeken en te redeneren. Ze mogen ook zwijgen terwijl het gesprek doorloopt, zodat ze opnemen waar het over gaat zonder zelf te spreken. En wat ze te melden hebben, kunnen ze ook in beeld brengen in plaats van het uit te spreken.
Hoe goed is dat live vertalen?
Daar past een kanttekening bij. In de demonstratie klonk het Hindi onnatuurlijk en met een uitgesproken Amerikaans accent. Er wordt gesteld dat er geoptimaliseerd is voor de meest gesproken talen, maar welke dat zijn wordt niet gepreciseerd.
Waarvoor zou je dit gebruiken?
De genoemde toepassingen zijn vertalen tijdens een gesprek, langere sessies van dertig tot veertig minuten, en werken zonder je handen te gebruiken bij complexere taken. Er wordt ook geopperd dat dit ooit in apparaten zoals oordopjes kan belanden.