Tilbake til Nyheter
ProduktAI Understanding orientering

Googles Gemini 3.5 transkribere dokumenter staver tale-til-tekst-moduser og grenser

Googles utviklerdokumentasjon beskriver hvordan Gemini 3.5 Transcribe håndterer lydfiler, inkludert automatisk språkdeteksjon, høyttalermerking, ordtidsstempler og ryddede "smarte" transkripsjoner. Siden dokumenterer også praktiske begrensninger, inkludert kortere maksimal lydvarighet når diarisering eller tidsstempler er...

6 min readRead the linked source
Source-provided image accompanying Google’s Gemini 3.5 Transcribe docs spell out speech-to-text modes and limits
KildereferanseKilde registrert
Utgiver
ai.google.dev
Kilde lenke
ai.google.devhttps://ai.google.dev/gemini-api/docs/transcribe
Kildetype
Koblet kilde – status for primærkilde er ikke etablert.
Også sitert

Historien sist revidert

KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

API (Application Programming Interface)
En strukturert måte for ett programvaresystem å sende forespørsler til og motta svar fra et annet system.
Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
Latens
Tiden mellom sending av en forespørsel og mottak av modellens utdata.
Test deg selvQuiz for forklaring av AI-modeller

Hva har endret seg siden publisering

  1. Først publisert
  2. The Verge fremmer den pågående Gemini 3.5 Transkriber-utgivelsen vesentlig ved å rapportere spesifikke funksjoner og utrullingsdetaljer: automatisk fjerning av utfyllingsord, tilpasset ordforråd, attribusjon for opptil tre høyttalere, tidsstempler på ordnivå, relaterte Gemini 3.5 Live-oppdateringer og utvikle utvalgte Android-oppdateringer, macOS og offentlig tilgang, macOS. Disse detaljene kommer fra The Verges rapport og Google sine påstander som sitert der; de er ikke uavhengig bekreftet i det leverte materialet.
  3. Denne Ars Technica-rapporten fremmer den eksisterende Gemini 3.5 Transkriberingsoppdateringen vesentlig ved å legge til Googles rapporterte ytelsestall, støtte for 85 språk og opptil tre høyttalere i forhåndsinnspilt lyd, tilpasset ordforrådsstøtte og en bredere utrulling på tvers av macOS, Antigravity, ZXZQAI, ZXZQAI, ZXZQAI-planleggingen og ZXZQAI-integrasjonen.
  4. Googles oppdaterte primærdokumentasjon utvider den tidligere Gemini 3.5 Transkriberingskunngjøringen vesentlig med API-eksempler, to transkripsjonsmoduser, støtte for mer enn 85 lokaliteter, opptil 1000 tilpassede ordforrådsfraser, opptil åtte høyttaleretiketter, ordkompatibilitetsgrensetider og eksplisitttider.

Hva skjedde

Googles Gemini API-dokumentasjon beskriver Gemini 3.5 Transcribe, en tale-til-tekst-modell for opplastede lydfiler. Siden gir implementeringsdetaljer for ordrett og smart transkripsjon, automatisk språkdeteksjon på tvers av mer enn 85 lokaliteter, tilpasset ordforråd, høyttalerdiaris og tidsstempler på ordnivå.

Google sin side sier at Gemini API konverterer opplastede lydfiler til tekst med Gemini 3.5 Transcribe-modellen, identifisert som gemini-3.5-transcribe. Den dokumenterte arbeidsflyten er å laste opp en lydfil gjennom Files API, sende dens URI til Interactions API og lese det returnerte transkripsjonen fra interaction.output_text. Siden inneholder eksempler på Python, JavaScript og REST. For sanntidsgjenkjenning med lav latens fra en mikrofon eller live lydstrøm, leder Google utviklere til en separat Live API-modell kalt gemini-3.5-transcribe-live.

Modellen er dokumentert å støtte automatisk språkgjenkjenning på tvers av mer enn 85 lokaliteter, inkludert flere varianter av engelsk, spansk, portugisisk, bengali, punjabi og kinesisk. Google sier at modellen kan bytte språk dynamisk når høyttalere kodebytter innenfor eller mellom setninger. Utviklere kan i stedet levere BCP-47 språkkoder når språket er kjent. Siden beskriver også tilpasset vokabular: opptil 1000 fraser kan leveres for å bias gjenkjennelse mot spesialiserte termer, akronymer, merkenavn og egennavn, selv om Google sier at de beste resultatene vanligvis kommer fra bruk av opptil 100 termer.

Siden beskriver to transkripsjonsmoduser. Ordrett-modus er standard og er ment å bevare det som ble sagt, inkludert utfyllingsord, repetisjoner, pauser og falske starter. Smart-modus bruker etterbehandling som fjerner forstyrrelser, løser opp talte selvkorrigeringer, legger til tegnsetting og små og store bokstaver, og formaterer opplest materiale til avsnitt, lister, datoer, valutaer og tall. Googles eksempel endrer en muntlig korreksjon fra "tirsdag, faktisk nei, onsdag" til en ryddet onsdagsavtale. Smart-modus kan ikke kombineres med høyttalerdiarisering eller tidsstempler på ordnivå.

Google dokumenterer også høyttalerdiarisering og timing på ordnivå som alternativer i ordrett modus. Diarisering merker distinkte stemmer med identifikatorer som spk_1 og spk_2, som støtter opptil åtte høyttalere; attribusjon for tre eller flere foredragsholdere beskrives som eksperimentell. Tidsstempler på ordnivå returnerer start- og sluttforskyvninger for gjenkjente ord, men Google advarer om at å aktivere dem kan redusere den totale nøyaktigheten av transkripsjon. Standard unære forespørsler støtter lydfiler i opptil én time, mens lydbehandling er begrenset til 30 minutter når diarisering eller tidsstempler på ordnivå er aktivert. Siden ble sist oppdatert 27. august 2026, og henviser utviklere andre steder for priser, tokengrenser og detaljer om filbehandling.

Kildedetaljer: ai.google.dev ↗

Hvorfor det betyr noe

Dokumentasjonen gjør modellens tidligere annonserte muligheter til en mer handlingsdyktig spesifikasjon for utviklere som bygger transkripsjonsarbeidsflyter. Det gjør også klart at nøyaktighet og funksjonalitet innebærer avveininger: Smart transkripsjon kan ikke gi høyttaleretiketter eller tidsstempler, mens tidsstempler kan redusere den totale nøyaktigheten av transkripsjon.

Den praktiske betydningen er at Google presenterer transkripsjon som en konfigurerbar modellarbeidsflyt i stedet for et enkelt udifferensiert talegjenkjenningsendepunkt. En utvikler kan velge bokstavelig utgang for poster eller analyse, eller ryddet ut for lesing. Språktips og tilpasset ordforråd tilbyr ekstra kontroller for spesialiserte opptak. Disse kontrollene kan redusere manuell opprydding og korrigering i enkelte arbeidsflyter, men kilden gir ikke sammenlignende nøyaktighetsmålinger eller bevis fra produksjonsdistribusjoner.

Høyttalermerking og timing på ordnivå er spesielt relevante for applikasjoner som trenger å navigere i et opptak i stedet for bare å produsere en tekstblokk. Etiketter kan skille svinger i et opptak med flere høyttalere, og forskyvninger kan støtte søk eller synkronisering med lyd. Etikettene identifiserer imidlertid distinkte stemmer i stedet for navngitte personer, og Google markerer eksplisitt attribusjon for tre eller flere høyttalere som eksperimentell. En transkripsjon med tidsstempler kan også være mindre nøyaktig generelt i henhold til dokumentasjonens advarsel, noe som skaper en avveining mellom navigerbarhet og troskap.

Språkstøtten beskrevet på siden kan ha betydning for flerspråklige møter, intervjuer, kundeserviceopptak og andre samtaler der foredragsholdere bytter språk. Automatisk gjenkjenning reduserer behovet for å konfigurere hvert opptak på forhånd, mens eksplisitte språkkoder kan forbedre resultatene når språket er kjent. Kilden etablerer likevel Googles uttalte støtte og oppførsel, ikke enhetlig ytelse på tvers av alle oppførte lokaliteter, aksenter, støyforhold eller kodebyttemønstre. Referansen til forskjellige aksenter og bakgrunnsstøy er et kapasitetskrav, ikke en medfølgende målestokk.

De dokumenterte grensene påvirker også systemdesign. Lange opptak kan kreve håndtering av filopplasting, og å legge til tidsstempler eller diarisering reduserer det oppgitte behandlingstaket fra én time til 30 minutter. Smart transkripsjon kan være enklere for leserne, men er uegnet når nøyaktig ordlyd, høyttalerattribusjon eller timing er nødvendig. Siden skiller også transkripsjon fra bredere lydspørsmålssvar og fra tekst-til-tale-syntese, så utviklere kan ikke anta at denne modellen er et generelt lydanalyse- eller stemmegenereringssystem. Priser, token-grenser, personvernvilkår og oppbevaringspraksis forblir utenfor informasjonen gitt her.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

De viktige neste spørsmålene er ytelse i opptak fra den virkelige verden, priser, token-grenser, datahåndtering og tilgjengelighet. Google gir ikke benchmarkresultater, oppbevaringsvilkår, forpliktelser på tjenestenivå eller detaljerte priser på denne siden, så dokumentasjonen etablerer kapasitet og begrensninger i stedet for uavhengig verifisert kvalitet.

Den første verifiseringsprioriteten er transkripsjonskvalitet i den virkelige verden. Uavhengig testing vil måtte undersøke aksenter, overlappende tale, bakgrunnsstøy, opptak av lav kvalitet, flerspråklig kodebytte og spesialisert terminologi på tvers av de oppførte stedene. Den bør sammenligne ordrett og smarte utdata, spesielt der smartmodus fjerner utfyllingsord eller løser rettelser som kan være viktige for den opprinnelige betydningen. Dokumentasjonen gir ingen ordfeilrater, språk-for-språk resultater eller eksempler fra ukontrollerte opptak.

Høyttalerattribusjon fortjener separat gransking. Google støtter opptil åtte høyttalere, men kaller attribusjon for tre eller flere eksperimentelle. Tester skal måle hvor ofte systemet deler en høyttaler i flere etiketter, slår sammen forskjellige høyttalere eller tildeler ord til feil person. Tilsvarende testing er nødvendig for ordtidsstempler, fordi siden advarer om at tidsstempler kan forringe den generelle transkripsjonsnøyaktigheten. Disse avveiningene er konsekvente for intervjuutskrifter, tilgjengelighetsverktøy, søkbare arkiver og enhver arbeidsflyt som behandler resultatet som en registrering.

Utviklere og organisasjoner bør også se driftsvilkårene som denne siden ikke spesifiserer. Google peker lesere til en prisside for modellpriser og tokengrenser, men disse tallene er ikke inkludert i kilden. Siden oppgir heller ikke regional tilgjengelighet, forpliktelser på tjenestenivå, støttede lydformater i en omfattende liste, oppbevaringsperioder, slettingskontroller eller om opplastede opptak brukes til andre formål. Disse ukjente kan påvirke adopsjonen vesentlig, spesielt for sensitive opptak eller høyvolumstjenester.

Til slutt vil forholdet mellom denne modellen og Googles andre lydverktøy ha betydning. Dokumentasjonen leder sanntidsbrukere til en egen Live-transkripsjonsbane, mens bredere lydanalyse tilhører lydforståelse og stemmegenerering tilhører tekst-til-tale. Denne inndelingen kan gi utviklere klarere grensesnitt, men det kan også kreve separate integrasjoner for live-opptak, transkripsjon, analyse og syntese. Ytterligere utgivelsesnotater, prisdetaljer, uavhengige evalueringer og bevis på bruk i konsekvente innstillinger vil vise om Gemini 3.5 Transcribe er mer enn en velspesifisert API-funksjon.

Relaterte guider og quizer

AI-modeller forklartKI-etikkAI treningTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren

Oppdateringer og rettelser

Denne kanoniske historien oppdateres på plass når utviklingshendelsen endres vesentlig. Nettadressen og den opprinnelige publiseringsdatoen endres aldri.

  • Googles oppdaterte primærdokumentasjon utvider den tidligere Gemini 3.5 Transkriberingskunngjøringen vesentlig med API-eksempler, to transkripsjonsmoduser, støtte for mer enn 85 lokaliteter, opptil 1000 tilpassede ordforrådsfraser, opptil åtte høyttaleretiketter, ordkompatibilitetsgrensetider og eksplisitttider.
  • Denne Ars Technica-rapporten fremmer den eksisterende Gemini 3.5 Transkriberingsoppdateringen vesentlig ved å legge til Googles rapporterte ytelsestall, støtte for 85 språk og opptil tre høyttalere i forhåndsinnspilt lyd, tilpasset ordforrådsstøtte og en bredere utrulling på tvers av macOS, Antigravity, ZXZQAI, ZXZQAI, ZXZQAI-planleggingen og ZXZQAI-integrasjonen.
  • The Verge fremmer den pågående Gemini 3.5 Transkriber-utgivelsen vesentlig ved å rapportere spesifikke funksjoner og utrullingsdetaljer: automatisk fjerning av utfyllingsord, tilpasset ordforråd, attribusjon for opptil tre høyttalere, tidsstempler på ordnivå, relaterte Gemini 3.5 Live-oppdateringer og utvikle utvalgte Android-oppdateringer, macOS og offentlig tilgang, macOS. Disse detaljene kommer fra The Verges rapport og Google sine påstander som sitert der; de er ikke uavhengig bekreftet i det leverte materialet.
Se den offentlige korreksjonsloggen
Fant du dette nyttig?