Terug naar Nieuws
ProductAI Understanding-briefing

Google's Gemini 3.5 Transcribe-documenten beschrijven spraak-naar-tekst-modi en -limieten

De ontwikkelaarsdocumentatie van Google beschrijft hoe Gemini 3.5 Transcribe omgaat met audiobestanden, inclusief automatische taaldetectie, sprekerlabeling, woordtijdstempels en opgeschoonde ‘slimme’ transcripties. De pagina documenteert ook praktische limieten, waaronder een kortere maximale audioduur wanneer dagboekregistratie of tijdstempels...

6 min readRead the linked source
Source-provided image accompanying Google’s Gemini 3.5 Transcribe docs spell out speech-to-text modes and limits
BronreferentieBron opgenomen
Uitgever
ai.google.dev
Bronlink
ai.google.devhttps://ai.google.dev/gemini-api/docs/transcribe
Brontype
Gekoppelde bron: de status van de primaire bron is niet vastgesteld.
Ook aangehaald

Verhaal laatst herzien

ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

API (Applicatieprogrammeringsinterface)
Een gestructureerde manier waarop het ene softwaresysteem verzoeken kan verzenden naar en antwoorden kan ontvangen van een ander systeem.
Benchmark
Een gestandaardiseerde test of dataset die wordt gebruikt om de prestaties van modellen te meten en te vergelijken.
Latentie
De tijd tussen het verzenden van een aanvraag en het ontvangen van de uitvoer van het model.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er veranderd sinds de publicatie

  1. Voor het eerst gepubliceerd
  2. The Verge brengt de voortdurende Gemini 3.5 Transcribe-release aanzienlijk vooruit door specifieke mogelijkheden en uitroldetails te rapporteren: automatische verwijdering van vulwoorden, aangepaste woordenschat, attributie voor maximaal drie sprekers, tijdstempels op woordniveau, gerelateerde Gemini 3.5 Live-updates, macOS en geselecteerde Android-beschikbaarheid, en openbare preview-toegang voor ontwikkelaars. Deze details zijn afkomstig uit het rapport van The Verge en de beweringen van Google zoals daar geciteerd; ze worden niet onafhankelijk bevestigd in het aangeleverde materiaal.
  3. Dit Ars Technica-rapport is een aanzienlijke vooruitgang in de bestaande Gemini 3.5 Transcribe-update door de gerapporteerde prestatiecijfers van Google toe te voegen, ondersteuning voor 85 talen en maximaal drie luidsprekers in vooraf opgenomen audio, ondersteuning voor aangepaste woordenschat en een bredere uitrol in macOS, Antigravity, AI Studio, de Gemini API en geplande Chrome-integratie.
  4. De bijgewerkte primaire documentatie van Google breidt de eerdere Gemini 3.5 Transcribe-aankondiging aanzienlijk uit met API-voorbeelden, twee transcriptiemodi, ondersteuning voor meer dan 85 talen, maximaal 1.000 aangepaste woordenschatzinnen, maximaal acht sprekerlabels, tijdstempels op woordniveau en expliciete duur- en compatibiliteitslimieten.

Wat is er gebeurd

De Gemini API-documentatie van Google beschrijft Gemini 3.5 Transcribe, een spraak-naar-tekst-model voor geüploade audiobestanden. De pagina biedt implementatiedetails voor woordelijke en slimme transcriptie, automatische taaldetectie in meer dan 85 talen, aangepast vocabulaire, sprekersdagboeken en tijdstempels op woordniveau.

Op de pagina van Google staat dat de Gemini API geüploade audiobestanden naar tekst converteert met het Gemini 3.5 Transcribe-model, geïdentificeerd als gemini-3.5-transcribe. De gedocumenteerde workflow bestaat uit het uploaden van een audiobestand via de Files API, het doorgeven van de URI aan de Interactions API en het lezen van het geretourneerde transcript van interactie.output_text. De pagina bevat voorbeelden van Python, JavaScript en REST. Voor realtime herkenning met lage latentie via een microfoon of live audiostream verwijst Google ontwikkelaars naar een afzonderlijk Live API-model genaamd gemini-3.5-transcribe-live.

Er is gedocumenteerd dat het model automatische taalherkenning ondersteunt in meer dan 85 landen, waaronder meerdere varianten van het Engels, Spaans, Portugees, Bengaals, Punjabi en Chinees. Google zegt dat het model dynamisch van taal kan wisselen wanneer sprekers binnen of tussen zinnen coderen. Ontwikkelaars kunnen in plaats daarvan BCP-47-taalcodes leveren als de taal bekend is. De pagina beschrijft ook aangepaste woordenschat: er kunnen maximaal 1.000 zinnen worden geleverd om de herkenning te vertekenen naar gespecialiseerde termen, acroniemen, merknamen en eigennamen, hoewel Google zegt dat de beste resultaten doorgaans voortkomen uit het gebruik van maximaal 100 termen.

De pagina beschrijft twee transcriptiemodi. De woordelijke modus is de standaardmodus en is bedoeld om te behouden wat er is gezegd, inclusief opvulwoorden, herhalingen, pauzes en valse starts. De slimme modus past nabewerking toe die onvloeiendheden verwijdert, gesproken zelfcorrecties oplost, interpunctie en zinshoofdletters toevoegt en gesproken materiaal opmaakt in alinea's, lijsten, datums, valuta's en cijfers. Het voorbeeld van Google verandert een gesproken correctie van “dinsdag, eigenlijk nee, woensdag” in een opgeruimde woensdagafspraak. De slimme modus kan niet worden gecombineerd met sprekerdiarisatie of tijdstempels op woordniveau.

Google documenteert ook de diarisatie van sprekers en de timing op woordniveau als opties binnen de woordelijke modus. Diarisatie labelt verschillende stemmen met identificatiegegevens zoals spk_1 en spk_2, en ondersteunt maximaal acht sprekers; attributie voor drie of meer sprekers wordt beschreven als experimenteel. Tijdstempels op woordniveau retourneren begin- en eindverschuivingen voor herkende woorden, maar Google waarschuwt dat het inschakelen ervan de algehele nauwkeurigheid van de transcriptie kan verminderen. Standaard unaire verzoeken ondersteunen audiobestanden van maximaal één uur, terwijl de audioverwerking beperkt is tot 30 minuten wanneer dagboekregistratie of tijdstempels op woordniveau zijn ingeschakeld. De pagina is voor het laatst bijgewerkt op 27 augustus 2026 en verwijst ontwikkelaars elders voor prijzen, tokenlimieten en details over bestandsbeheer.

Brongegevens: ai.google.dev ↗

Waarom het ertoe doet

De documentatie zet de eerder aangekondigde mogelijkheden van het model om in een meer bruikbare specificatie voor ontwikkelaars die transcriptieworkflows bouwen. Het maakt ook duidelijk dat nauwkeurigheid en functionaliteit compromissen met zich meebrengen: slimme transcriptie kan geen sprekerlabels of tijdstempels bieden, terwijl tijdstempels de algehele nauwkeurigheid van de transcriptie kunnen verminderen.

De praktische betekenis is dat Google transcriptie presenteert als een configureerbare modelworkflow in plaats van als een enkel ongedifferentieerd eindpunt voor spraakherkenning. Een ontwikkelaar kan letterlijke uitvoer kiezen voor records of analyse, of opgeschoonde uitvoer om te lezen. Taalhints en aangepaste woordenschat bieden extra bedieningselementen voor gespecialiseerde opnames. Deze controles zouden het handmatig opschonen en corrigeren in sommige workflows kunnen verminderen, maar de bron biedt geen vergelijkende nauwkeurigheidsmetingen of bewijsmateriaal van productie-implementaties.

Luidsprekerlabeling en timing op woordniveau zijn met name relevant voor toepassingen die door een opname moeten navigeren in plaats van eenvoudigweg een tekstblok te produceren. Labels kunnen beurten scheiden in een opname met meerdere luidsprekers, en offsets kunnen zoeken of synchronisatie met audio ondersteunen. De labels identificeren echter verschillende stemmen in plaats van genoemde mensen, en Google markeert de toeschrijving voor drie of meer sprekers expliciet als experimenteel. Een transcriptie met tijdstempels kan volgens de waarschuwing in de documentatie over het algemeen ook minder nauwkeurig zijn, waardoor er een afweging ontstaat tussen navigeerbaarheid en betrouwbaarheid.

De taalondersteuning die op de pagina wordt beschreven, kan van belang zijn voor meertalige vergaderingen, interviews, opnames van de klantenservice en andere gesprekken waarin sprekers van taal wisselen. Automatische detectie vermindert de noodzaak om elke opname vooraf te configureren, terwijl expliciete taalcodes de resultaten kunnen verbeteren als de taal bekend is. Toch stelt de bron de aangegeven ondersteuning en het gedrag van Google vast, en niet uniforme prestaties voor alle vermelde locaties, accenten, ruisomstandigheden of code-schakelpatronen. De verwijzing naar diverse accenten en achtergrondgeluiden is een claim op capaciteiten, en geen geleverde maatstaf.

De gedocumenteerde limieten zijn ook van invloed op het systeemontwerp. Bij lange opnames kan het nodig zijn dat bestanden worden geüpload, en door het toevoegen van tijdstempels of dagboekregistratie wordt het aangegeven verwerkingsplafond teruggebracht van één uur naar 30 minuten. Slimme transcriptie is misschien gemakkelijker voor lezers, maar is niet geschikt als exacte bewoordingen, toeschrijving van de spreker of timing vereist zijn. De pagina scheidt ook transcriptie van bredere audio-antwoordvragen en van tekst-naar-spraak-synthese, dus ontwikkelaars kunnen er niet van uitgaan dat dit model een algemeen systeem voor audioanalyse of stemgeneratie is. Prijzen, tokenlimieten, privacyvoorwaarden en bewaarpraktijken vallen buiten de hier verstrekte informatie.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

De belangrijke volgende vragen zijn prestaties in real-world opnames, prijzen, tokenlimieten, gegevensverwerking en beschikbaarheid. Google biedt op deze pagina geen benchmarkresultaten, retentievoorwaarden, serviceniveauverplichtingen of gedetailleerde prijzen, dus de documentatie stelt de mogelijkheden en beperkingen vast in plaats van onafhankelijk geverifieerde kwaliteit.

De eerste verificatieprioriteit is transcriptiekwaliteit in de echte wereld. Onafhankelijke tests zouden accenten, overlappende spraak, achtergrondgeluid, opnames van lage kwaliteit, meertalige codewisseling en gespecialiseerde terminologie in de genoemde landen moeten onderzoeken. Het moet letterlijke en slimme resultaten vergelijken, vooral wanneer de slimme modus vulwoorden verwijdert of correcties oplost die belangrijk kunnen zijn voor de oorspronkelijke betekenis. De documentatie geeft geen woordfoutenpercentages, taal-per-taalresultaten of voorbeelden van ongecontroleerde opnames.

De toeschrijving van sprekers verdient afzonderlijk onderzoek. Google ondersteunt maximaal acht sprekers, maar noemt attributie voor drie of meer experimenteel. Tests moeten meten hoe vaak het systeem een ​​spreker in meerdere labels opsplitst, verschillende sprekers samenvoegt of woorden aan de verkeerde persoon toewijst. Soortgelijke tests zijn nodig voor woordtijdstempels, omdat de pagina waarschuwt dat tijdstempels de algehele nauwkeurigheid van de transcriptie kunnen aantasten. Deze afwegingen hebben gevolgen voor transcripties van interviews, toegankelijkheidstools, doorzoekbare archieven en elke workflow die de output als een record behandelt.

Ontwikkelaars en organisaties moeten ook letten op de operationele voorwaarden die deze pagina niet specificeert. Google verwijst lezers naar een prijspagina voor modelprijzen en tokenlimieten, maar die cijfers zijn niet opgenomen in de bron. De pagina vermeldt ook niet de regionale beschikbaarheid, serviceniveauverplichtingen, ondersteunde audioformaten in een uitgebreide lijst, bewaartermijnen, verwijderingscontroles of dat geüploade opnamen voor andere doeleinden worden gebruikt. Deze onbekende factoren kunnen de adoptie aanzienlijk beïnvloeden, vooral voor gevoelige opnames of diensten met een hoog volume.

Ten slotte zal de relatie tussen dit model en de andere audiotools van de Google er toe doen. De documentatie leidt real-time gebruikers naar een afzonderlijk live transcriptiepad, terwijl bredere audioanalyse tot audiobegrip behoort en stemgeneratie tot tekst-naar-spraak. Die indeling kan ontwikkelaars duidelijkere interfaces geven, maar kan ook afzonderlijke integraties vereisen voor live vastleggen, transcriptie, analyse en synthese. Verdere releaseopmerkingen, prijsdetails, onafhankelijke evaluaties en bewijs van gebruik in vervolgomgevingen zouden aantonen of Gemini 3.5 Transcribe meer is dan een goed gespecificeerde API-mogelijkheid.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdAI-ethiekAI-trainingTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker

Updates en correcties

Dit canonieke verhaal wordt op zijn plaats bijgewerkt wanneer de zich ontwikkelende gebeurtenis wezenlijk verandert. De URL en de oorspronkelijke publicatiedatum veranderen nooit.

  • De bijgewerkte primaire documentatie van Google breidt de eerdere Gemini 3.5 Transcribe-aankondiging aanzienlijk uit met API-voorbeelden, twee transcriptiemodi, ondersteuning voor meer dan 85 talen, maximaal 1.000 aangepaste woordenschatzinnen, maximaal acht sprekerlabels, tijdstempels op woordniveau en expliciete duur- en compatibiliteitslimieten.
  • Dit Ars Technica-rapport is een aanzienlijke vooruitgang in de bestaande Gemini 3.5 Transcribe-update door de gerapporteerde prestatiecijfers van Google toe te voegen, ondersteuning voor 85 talen en maximaal drie luidsprekers in vooraf opgenomen audio, ondersteuning voor aangepaste woordenschat en een bredere uitrol in macOS, Antigravity, AI Studio, de Gemini API en geplande Chrome-integratie.
  • The Verge brengt de voortdurende Gemini 3.5 Transcribe-release aanzienlijk vooruit door specifieke mogelijkheden en uitroldetails te rapporteren: automatische verwijdering van vulwoorden, aangepaste woordenschat, attributie voor maximaal drie sprekers, tijdstempels op woordniveau, gerelateerde Gemini 3.5 Live-updates, macOS en geselecteerde Android-beschikbaarheid, en openbare preview-toegang voor ontwikkelaars. Deze details zijn afkomstig uit het rapport van The Verge en de beweringen van Google zoals daar geciteerd; ze worden niet onafhankelijk bevestigd in het aangeleverde materiaal.
Zie het openbare correctielogboek
Vond je dit nuttig?