Gemini voegt realistischere stemkloning en dramatische spraakmogelijkheden toe
Google breidt de mogelijkheden van zijn Gemini kunstmatige intelligentie modellen uit met nieuwe text-to-speech technologie die is ontworpen om expressievere en natuurlijk klinkende stemmen te produceren. De nieuwste systemen kunnen een breder scala aan vocale kenmerken reproduceren, waardoor gegenereerde spraak veranderingen in toon, accent, ritme en emotie kan weerspiegelen.
De update maakt deel uit van Google’s bredere ontwikkeling van de Gemini-familie, terwijl het bedrijf doorgaat met het overstijgen van basis tekstgeneratie naar multimodale AI-systemen die in staat zijn om met stem, beelden, video en andere vormen van content te werken.
Onder de nieuwe aanbiedingen zijn Gemini Flash TTS en Flash-Lite TTS, die gebruikers en ontwikkelaars meer controle geven over hoe gegenereerde spraak wordt geleverd. In plaats van simpelweg geschreven tekst om te zetten in gesproken woorden, kunnen de modellen gedetailleerde instructies volgen die beschrijven hoe een bepaalde zin zou moeten klinken, inclusief veranderingen in tempo, intensiteit, pauzes, fluisteren, lachen en andere vocale aanwijzingen.
Google zegt dat zijn technologie originele stemmen kan genereren op basis van beschrijvingen in natuurlijke taal en meer dan 100 talen en dialecten ondersteunt. Het bedrijf maakt ook een grote bibliotheek van kant-en-klare stemmen beschikbaar voor productie doeleinden, terwijl een korte stemsample kan worden gebruikt om een consistente synthetische stem te creëren wanneer de gebruiker de nodige toestemming heeft.
De technologie is bijzonder geschikt voor situaties met dialoog en op prestaties gebaseerde vertolkingen. Een enkel script kan worden omgevormd tot een gesprek met verschillende stemmen, waarbij het systeem consistentie tussen personages behoudt over langere opnames. Dergelijke mogelijkheden kunnen nuttig zijn voor podcasts, audioboeken, nasynchronisatie, ingesproken video's en stemgebaseerde toepassingen.
De verbeteringen weerspiegelen ook de toenemende concurrentie op de markt voor AI-gegenereerde stemmen, waar bedrijven proberen synthetische spraak steeds natuurlijker en expressiever te laten klinken. Google’s eigen tests hebben sterke resultaten laten zien in verschillende evaluaties van stemkwaliteit, hoewel concurrerende diensten ook goed presteerden in specifieke categorieën met betrekking tot vocaal realisme en diversiteit.
De nieuwe technologie is niet beperkt tot ontwikkelaars. Google is begonnen met het integreren van zijn stemmodellen in producten zoals NotebookLM, terwijl Flash-Lite TTS ook wordt geïntroduceerd in Google Vids. Ontwikkelaars kunnen toegang krijgen tot de modellen via Google’s AI-ontwikkelingshulpmiddelen en API's, waardoor de technologie toegankelijk wordt voor een breder scala aan toepassingen.
Stemkloning roept ook belangrijke vragen op over toestemming, impersonatie en het potentiële misbruik van synthetische stemmen. Google heeft daarom waarborgen geïntroduceerd die toestemming vereisen om de stem van een persoon te reproduceren en maakt gebruik van technologieën zoals SynthID en C2PA-credentials om te helpen bij het identificeren van AI-gegeneerde content.
De beschikbaarheid van sommige stemkloningsfuncties is ook onderhevig aan regionale beperkingen, wat de verschillende regelgevende en juridische omgevingen rond synthetische media weerspiegelt.
Met deze ontwikkelingen beweegt de spraaktechnologie van Gemini naar een meer prestatiegerichte benadering waarin AI-gegeneerde stemmen niet alleen woorden kunnen overbrengen, maar ook elementen van levering en emotie. De verschuiving illustreert hoe generatieve AI steeds meer wordt geïntegreerd in creatieve productie, terwijl vragen rond toestemming, transparantie en verantwoord gebruik centraal blijven staan in de ontwikkeling van stemkloningstechnologie.
-
21:00
-
20:32
-
20:15
-
20:00
-
19:40
-
19:19
-
19:00
-
18:35
-
18:15
-
18:00
-
17:30
-
17:15
-
16:50
-
16:33
-
16:16
-
16:00
-
15:42
-
15:25
-
15:10
-
14:47
-
14:32
-
14:15
-
14:00
-
13:40
-
13:20
-
13:05
-
12:45
-
12:30
-
12:12
-
11:47
-
11:32
-
11:15
-
11:00
-
10:42
-
10:25
-
10:10
-
10:10
-
09:47
-
09:30