Google lanceert Gemini 3.5 Transcribe om spraaktranscriptie in realtime te versnellen
Google zet een nieuwe stap op het gebied van spraakgestuurde kunstmatige intelligentie met de lancering van Gemini 3.5 Transcribe, een nieuw model dat is ontworpen om spraak om te zetten in tekst met meer snelheid en precisie. Dit is bedoeld voor zowel ontwikkelaars als bedrijven en heeft als doel te voldoen aan de groeiende behoefte aan directe transcriptie van gesprekken, vergaderingen en audio-opnames.
Het nieuwe model onderscheidt zich vooral door zijn vermogen om spraak in complexe omgevingen te verwerken. Achtergrondgeluiden, technische terminologie, aarzeling of correcties door de sprekers kunnen worden meegenomen om de kwaliteit van de gegenereerde tekst te verbeteren.
Volgens de verstrekte gegevens heeft Gemini 3.5 Transcribe een foutpercentage van 4% voor continue transcriptie en 2,6% voor de verwerking van audio buiten de stroom. De tijd die nodig is om een definitieve transcriptie te verkrijgen, zou ook met 70% zijn verminderd ten opzichte van het vorige model Chirp 3.
Een transcriptie beschikbaar in realtime of na opname
Google biedt twee gebruiksmethoden aan die zijn afgestemd op verschillende behoeften. De eerste maakt bijna onmiddellijke transcriptie mogelijk dankzij een live-uitzendinterface met een latentie van minder dan een seconde.
De tweede is bedoeld voor al opgenomen audio-inhoud, zoals zakelijke vergaderingen of oproeplogs. Deze versie maakt het ook mogelijk om de bijdragen van verschillende deelnemers te identificeren en toe te wijzen.
Het model is in staat om automatisch meer dan 85 talen te detecteren en te transcriberen. Het kan ook tot drie gesprekspartners in dezelfde opname herkennen en hun bijdragen aan tijdstempels koppelen.
Onder de aangekondigde functies bevinden zich ook het verwijderen van vulwoorden, automatische tekstopmaak en de mogelijkheid om een gepersonaliseerd vocabulaire te integreren om de herkenning van specifieke termen in bepaalde sectoren te verbeteren.
Google breidt het gebruik van zijn spraakgestuurde kunstmatige intelligentie uit
Op de benchmark FLEURS heeft Gemini 3.5 Transcribe een foutpercentage van 5,50% in uitzendmodus en 5,04% voor inhoud die buiten de stroom wordt verwerkt, volgens de verstrekte informatie.
Google is van plan om deze technologie geleidelijk in verschillende van zijn producten en diensten te integreren. Het model is onder andere gekoppeld aan de Gemini-app op macOS, bepaalde functies op Android via Gboard en Google AI Studio.
De lancering vindt ook plaats in het kader van een bredere strategie om de integratie van generatieve kunstmatige intelligentie in zowel professionele als consumentenhulpmiddelen te versterken. Ontwikkelaars kunnen toegang krijgen tot het model via een openbare preview via Google AI Studio, terwijl bedrijven integratie hebben via het Gemini Enterprise Agent-platform.
Op termijn zou de Chrome-browser ook nieuwe dicteerfuncties moeten krijgen die op deze technologie zijn gebaseerd. Met Gemini 3.5 Transcribe streeft Google ernaar om spraak een steeds centralere interface te maken in het dagelijkse gebruik van digitale hulpmiddelen.
-
13:26
-
13:21
-
13:06
-
11:11
-
11:06
-
11:05
-
10:59
-
10:54
-
10:41
-
10:35
-
10:22
-
10:05
-
09:51
-
09:06
-
08:56
-
08:50
-
08:43
-
08:37
-
08:30
-
08:14
-
08:02
-
07:51
-
07:36
-
07:30
-
17:07
-
17:01
-
16:55
-
16:23
-
16:02
-
15:53
-
15:47
-
15:46
-
15:16
-
15:01
-
14:57
-
14:52
-
14:49
-
14:37
-
14:19
-
14:00
-
13:53
-
13:44
-
13:35
-
13:32
-
13:29