Wat is er gebeurd
De Gemini API-documentatie van Google beschrijft Gemini 3.5 Transcribe, een spraak-naar-tekst-model voor geüploade audiobestanden. De pagina biedt implementatiedetails voor woordelijke en slimme transcriptie, automatische taaldetectie in meer dan 85 talen, aangepast vocabulaire, sprekersdagboeken en tijdstempels op woordniveau.
Op de pagina van Google staat dat de Gemini API geüploade audiobestanden naar tekst converteert met het Gemini 3.5 Transcribe-model, geïdentificeerd als gemini-3.5-transcribe. De gedocumenteerde workflow bestaat uit het uploaden van een audiobestand via de Files API, het doorgeven van de URI aan de Interactions API en het lezen van het geretourneerde transcript van interactie.output_text. De pagina bevat voorbeelden van Python, JavaScript en REST. Voor realtime herkenning met lage latentie via een microfoon of live audiostream verwijst Google ontwikkelaars naar een afzonderlijk Live API-model genaamd gemini-3.5-transcribe-live.
Er is gedocumenteerd dat het model automatische taalherkenning ondersteunt in meer dan 85 landen, waaronder meerdere varianten van het Engels, Spaans, Portugees, Bengaals, Punjabi en Chinees. Google zegt dat het model dynamisch van taal kan wisselen wanneer sprekers binnen of tussen zinnen coderen. Ontwikkelaars kunnen in plaats daarvan BCP-47-taalcodes leveren als de taal bekend is. De pagina beschrijft ook aangepaste woordenschat: er kunnen maximaal 1.000 zinnen worden geleverd om de herkenning te vertekenen naar gespecialiseerde termen, acroniemen, merknamen en eigennamen, hoewel Google zegt dat de beste resultaten doorgaans voortkomen uit het gebruik van maximaal 100 termen.
De pagina beschrijft twee transcriptiemodi. De woordelijke modus is de standaardmodus en is bedoeld om te behouden wat er is gezegd, inclusief opvulwoorden, herhalingen, pauzes en valse starts. De slimme modus past nabewerking toe die onvloeiendheden verwijdert, gesproken zelfcorrecties oplost, interpunctie en zinshoofdletters toevoegt en gesproken materiaal opmaakt in alinea's, lijsten, datums, valuta's en cijfers. Het voorbeeld van Google verandert een gesproken correctie van “dinsdag, eigenlijk nee, woensdag” in een opgeruimde woensdagafspraak. De slimme modus kan niet worden gecombineerd met sprekerdiarisatie of tijdstempels op woordniveau.
Google documenteert ook de diarisatie van sprekers en de timing op woordniveau als opties binnen de woordelijke modus. Diarisatie labelt verschillende stemmen met identificatiegegevens zoals spk_1 en spk_2, en ondersteunt maximaal acht sprekers; attributie voor drie of meer sprekers wordt beschreven als experimenteel. Tijdstempels op woordniveau retourneren begin- en eindverschuivingen voor herkende woorden, maar Google waarschuwt dat het inschakelen ervan de algehele nauwkeurigheid van de transcriptie kan verminderen. Standaard unaire verzoeken ondersteunen audiobestanden van maximaal één uur, terwijl de audioverwerking beperkt is tot 30 minuten wanneer dagboekregistratie of tijdstempels op woordniveau zijn ingeschakeld. De pagina is voor het laatst bijgewerkt op 27 augustus 2026 en verwijst ontwikkelaars elders voor prijzen, tokenlimieten en details over bestandsbeheer.
Waarom het ertoe doet
De documentatie zet de eerder aangekondigde mogelijkheden van het model om in een meer bruikbare specificatie voor ontwikkelaars die transcriptieworkflows bouwen. Het maakt ook duidelijk dat nauwkeurigheid en functionaliteit compromissen met zich meebrengen: slimme transcriptie kan geen sprekerlabels of tijdstempels bieden, terwijl tijdstempels de algehele nauwkeurigheid van de transcriptie kunnen verminderen.
De praktische betekenis is dat Google transcriptie presenteert als een configureerbare modelworkflow in plaats van als een enkel ongedifferentieerd eindpunt voor spraakherkenning. Een ontwikkelaar kan letterlijke uitvoer kiezen voor records of analyse, of opgeschoonde uitvoer om te lezen. Taalhints en aangepaste woordenschat bieden extra bedieningselementen voor gespecialiseerde opnames. Deze controles zouden het handmatig opschonen en corrigeren in sommige workflows kunnen verminderen, maar de bron biedt geen vergelijkende nauwkeurigheidsmetingen of bewijsmateriaal van productie-implementaties.
Luidsprekerlabeling en timing op woordniveau zijn met name relevant voor toepassingen die door een opname moeten navigeren in plaats van eenvoudigweg een tekstblok te produceren. Labels kunnen beurten scheiden in een opname met meerdere luidsprekers, en offsets kunnen zoeken of synchronisatie met audio ondersteunen. De labels identificeren echter verschillende stemmen in plaats van genoemde mensen, en Google markeert de toeschrijving voor drie of meer sprekers expliciet als experimenteel. Een transcriptie met tijdstempels kan volgens de waarschuwing in de documentatie over het algemeen ook minder nauwkeurig zijn, waardoor er een afweging ontstaat tussen navigeerbaarheid en betrouwbaarheid.
De taalondersteuning die op de pagina wordt beschreven, kan van belang zijn voor meertalige vergaderingen, interviews, opnames van de klantenservice en andere gesprekken waarin sprekers van taal wisselen. Automatische detectie vermindert de noodzaak om elke opname vooraf te configureren, terwijl expliciete taalcodes de resultaten kunnen verbeteren als de taal bekend is. Toch stelt de bron de aangegeven ondersteuning en het gedrag van Google vast, en niet uniforme prestaties voor alle vermelde locaties, accenten, ruisomstandigheden of code-schakelpatronen. De verwijzing naar diverse accenten en achtergrondgeluiden is een claim op capaciteiten, en geen geleverde maatstaf.
De gedocumenteerde limieten zijn ook van invloed op het systeemontwerp. Bij lange opnames kan het nodig zijn dat bestanden worden geüpload, en door het toevoegen van tijdstempels of dagboekregistratie wordt het aangegeven verwerkingsplafond teruggebracht van één uur naar 30 minuten. Slimme transcriptie is misschien gemakkelijker voor lezers, maar is niet geschikt als exacte bewoordingen, toeschrijving van de spreker of timing vereist zijn. De pagina scheidt ook transcriptie van bredere audio-antwoordvragen en van tekst-naar-spraak-synthese, dus ontwikkelaars kunnen er niet van uitgaan dat dit model een algemeen systeem voor audioanalyse of stemgeneratie is. Prijzen, tokenlimieten, privacyvoorwaarden en bewaarpraktijken vallen buiten de hier verstrekte informatie.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
De belangrijke volgende vragen zijn prestaties in real-world opnames, prijzen, tokenlimieten, gegevensverwerking en beschikbaarheid. Google biedt op deze pagina geen benchmarkresultaten, retentievoorwaarden, serviceniveauverplichtingen of gedetailleerde prijzen, dus de documentatie stelt de mogelijkheden en beperkingen vast in plaats van onafhankelijk geverifieerde kwaliteit.
De eerste verificatieprioriteit is transcriptiekwaliteit in de echte wereld. Onafhankelijke tests zouden accenten, overlappende spraak, achtergrondgeluid, opnames van lage kwaliteit, meertalige codewisseling en gespecialiseerde terminologie in de genoemde landen moeten onderzoeken. Het moet letterlijke en slimme resultaten vergelijken, vooral wanneer de slimme modus vulwoorden verwijdert of correcties oplost die belangrijk kunnen zijn voor de oorspronkelijke betekenis. De documentatie geeft geen woordfoutenpercentages, taal-per-taalresultaten of voorbeelden van ongecontroleerde opnames.
De toeschrijving van sprekers verdient afzonderlijk onderzoek. Google ondersteunt maximaal acht sprekers, maar noemt attributie voor drie of meer experimenteel. Tests moeten meten hoe vaak het systeem een spreker in meerdere labels opsplitst, verschillende sprekers samenvoegt of woorden aan de verkeerde persoon toewijst. Soortgelijke tests zijn nodig voor woordtijdstempels, omdat de pagina waarschuwt dat tijdstempels de algehele nauwkeurigheid van de transcriptie kunnen aantasten. Deze afwegingen hebben gevolgen voor transcripties van interviews, toegankelijkheidstools, doorzoekbare archieven en elke workflow die de output als een record behandelt.
Ontwikkelaars en organisaties moeten ook letten op de operationele voorwaarden die deze pagina niet specificeert. Google verwijst lezers naar een prijspagina voor modelprijzen en tokenlimieten, maar die cijfers zijn niet opgenomen in de bron. De pagina vermeldt ook niet de regionale beschikbaarheid, serviceniveauverplichtingen, ondersteunde audioformaten in een uitgebreide lijst, bewaartermijnen, verwijderingscontroles of dat geüploade opnamen voor andere doeleinden worden gebruikt. Deze onbekende factoren kunnen de adoptie aanzienlijk beïnvloeden, vooral voor gevoelige opnames of diensten met een hoog volume.
Ten slotte zal de relatie tussen dit model en de andere audiotools van de Google er toe doen. De documentatie leidt real-time gebruikers naar een afzonderlijk live transcriptiepad, terwijl bredere audioanalyse tot audiobegrip behoort en stemgeneratie tot tekst-naar-spraak. Die indeling kan ontwikkelaars duidelijkere interfaces geven, maar kan ook afzonderlijke integraties vereisen voor live vastleggen, transcriptie, analyse en synthese. Verdere releaseopmerkingen, prijsdetails, onafhankelijke evaluaties en bewijs van gebruik in vervolgomgevingen zouden aantonen of Gemini 3.5 Transcribe meer is dan een goed gespecificeerde API-mogelijkheid.