Hva skjedde
Googles Gemini API-dokumentasjon beskriver Gemini 3.5 Transcribe, en tale-til-tekst-modell for opplastede lydfiler. Siden gir implementeringsdetaljer for ordrett og smart transkripsjon, automatisk språkdeteksjon på tvers av mer enn 85 lokaliteter, tilpasset ordforråd, høyttalerdiaris og tidsstempler på ordnivå.
Google sin side sier at Gemini API konverterer opplastede lydfiler til tekst med Gemini 3.5 Transcribe-modellen, identifisert som gemini-3.5-transcribe. Den dokumenterte arbeidsflyten er å laste opp en lydfil gjennom Files API, sende dens URI til Interactions API og lese det returnerte transkripsjonen fra interaction.output_text. Siden inneholder eksempler på Python, JavaScript og REST. For sanntidsgjenkjenning med lav latens fra en mikrofon eller live lydstrøm, leder Google utviklere til en separat Live API-modell kalt gemini-3.5-transcribe-live.
Modellen er dokumentert å støtte automatisk språkgjenkjenning på tvers av mer enn 85 lokaliteter, inkludert flere varianter av engelsk, spansk, portugisisk, bengali, punjabi og kinesisk. Google sier at modellen kan bytte språk dynamisk når høyttalere kodebytter innenfor eller mellom setninger. Utviklere kan i stedet levere BCP-47 språkkoder når språket er kjent. Siden beskriver også tilpasset vokabular: opptil 1000 fraser kan leveres for å bias gjenkjennelse mot spesialiserte termer, akronymer, merkenavn og egennavn, selv om Google sier at de beste resultatene vanligvis kommer fra bruk av opptil 100 termer.
Siden beskriver to transkripsjonsmoduser. Ordrett-modus er standard og er ment å bevare det som ble sagt, inkludert utfyllingsord, repetisjoner, pauser og falske starter. Smart-modus bruker etterbehandling som fjerner forstyrrelser, løser opp talte selvkorrigeringer, legger til tegnsetting og små og store bokstaver, og formaterer opplest materiale til avsnitt, lister, datoer, valutaer og tall. Googles eksempel endrer en muntlig korreksjon fra "tirsdag, faktisk nei, onsdag" til en ryddet onsdagsavtale. Smart-modus kan ikke kombineres med høyttalerdiarisering eller tidsstempler på ordnivå.
Google dokumenterer også høyttalerdiarisering og timing på ordnivå som alternativer i ordrett modus. Diarisering merker distinkte stemmer med identifikatorer som spk_1 og spk_2, som støtter opptil åtte høyttalere; attribusjon for tre eller flere foredragsholdere beskrives som eksperimentell. Tidsstempler på ordnivå returnerer start- og sluttforskyvninger for gjenkjente ord, men Google advarer om at å aktivere dem kan redusere den totale nøyaktigheten av transkripsjon. Standard unære forespørsler støtter lydfiler i opptil én time, mens lydbehandling er begrenset til 30 minutter når diarisering eller tidsstempler på ordnivå er aktivert. Siden ble sist oppdatert 27. august 2026, og henviser utviklere andre steder for priser, tokengrenser og detaljer om filbehandling.
Kildedetaljer: ai.google.dev ↗
Hvorfor det betyr noe
Dokumentasjonen gjør modellens tidligere annonserte muligheter til en mer handlingsdyktig spesifikasjon for utviklere som bygger transkripsjonsarbeidsflyter. Det gjør også klart at nøyaktighet og funksjonalitet innebærer avveininger: Smart transkripsjon kan ikke gi høyttaleretiketter eller tidsstempler, mens tidsstempler kan redusere den totale nøyaktigheten av transkripsjon.
Den praktiske betydningen er at Google presenterer transkripsjon som en konfigurerbar modellarbeidsflyt i stedet for et enkelt udifferensiert talegjenkjenningsendepunkt. En utvikler kan velge bokstavelig utgang for poster eller analyse, eller ryddet ut for lesing. Språktips og tilpasset ordforråd tilbyr ekstra kontroller for spesialiserte opptak. Disse kontrollene kan redusere manuell opprydding og korrigering i enkelte arbeidsflyter, men kilden gir ikke sammenlignende nøyaktighetsmålinger eller bevis fra produksjonsdistribusjoner.
Høyttalermerking og timing på ordnivå er spesielt relevante for applikasjoner som trenger å navigere i et opptak i stedet for bare å produsere en tekstblokk. Etiketter kan skille svinger i et opptak med flere høyttalere, og forskyvninger kan støtte søk eller synkronisering med lyd. Etikettene identifiserer imidlertid distinkte stemmer i stedet for navngitte personer, og Google markerer eksplisitt attribusjon for tre eller flere høyttalere som eksperimentell. En transkripsjon med tidsstempler kan også være mindre nøyaktig generelt i henhold til dokumentasjonens advarsel, noe som skaper en avveining mellom navigerbarhet og troskap.
Språkstøtten beskrevet på siden kan ha betydning for flerspråklige møter, intervjuer, kundeserviceopptak og andre samtaler der foredragsholdere bytter språk. Automatisk gjenkjenning reduserer behovet for å konfigurere hvert opptak på forhånd, mens eksplisitte språkkoder kan forbedre resultatene når språket er kjent. Kilden etablerer likevel Googles uttalte støtte og oppførsel, ikke enhetlig ytelse på tvers av alle oppførte lokaliteter, aksenter, støyforhold eller kodebyttemønstre. Referansen til forskjellige aksenter og bakgrunnsstøy er et kapasitetskrav, ikke en medfølgende målestokk.
De dokumenterte grensene påvirker også systemdesign. Lange opptak kan kreve håndtering av filopplasting, og å legge til tidsstempler eller diarisering reduserer det oppgitte behandlingstaket fra én time til 30 minutter. Smart transkripsjon kan være enklere for leserne, men er uegnet når nøyaktig ordlyd, høyttalerattribusjon eller timing er nødvendig. Siden skiller også transkripsjon fra bredere lydspørsmålssvar og fra tekst-til-tale-syntese, så utviklere kan ikke anta at denne modellen er et generelt lydanalyse- eller stemmegenereringssystem. Priser, token-grenser, personvernvilkår og oppbevaringspraksis forblir utenfor informasjonen gitt her.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Hva du skal se neste
De viktige neste spørsmålene er ytelse i opptak fra den virkelige verden, priser, token-grenser, datahåndtering og tilgjengelighet. Google gir ikke benchmarkresultater, oppbevaringsvilkår, forpliktelser på tjenestenivå eller detaljerte priser på denne siden, så dokumentasjonen etablerer kapasitet og begrensninger i stedet for uavhengig verifisert kvalitet.
Den første verifiseringsprioriteten er transkripsjonskvalitet i den virkelige verden. Uavhengig testing vil måtte undersøke aksenter, overlappende tale, bakgrunnsstøy, opptak av lav kvalitet, flerspråklig kodebytte og spesialisert terminologi på tvers av de oppførte stedene. Den bør sammenligne ordrett og smarte utdata, spesielt der smartmodus fjerner utfyllingsord eller løser rettelser som kan være viktige for den opprinnelige betydningen. Dokumentasjonen gir ingen ordfeilrater, språk-for-språk resultater eller eksempler fra ukontrollerte opptak.
Høyttalerattribusjon fortjener separat gransking. Google støtter opptil åtte høyttalere, men kaller attribusjon for tre eller flere eksperimentelle. Tester skal måle hvor ofte systemet deler en høyttaler i flere etiketter, slår sammen forskjellige høyttalere eller tildeler ord til feil person. Tilsvarende testing er nødvendig for ordtidsstempler, fordi siden advarer om at tidsstempler kan forringe den generelle transkripsjonsnøyaktigheten. Disse avveiningene er konsekvente for intervjuutskrifter, tilgjengelighetsverktøy, søkbare arkiver og enhver arbeidsflyt som behandler resultatet som en registrering.
Utviklere og organisasjoner bør også se driftsvilkårene som denne siden ikke spesifiserer. Google peker lesere til en prisside for modellpriser og tokengrenser, men disse tallene er ikke inkludert i kilden. Siden oppgir heller ikke regional tilgjengelighet, forpliktelser på tjenestenivå, støttede lydformater i en omfattende liste, oppbevaringsperioder, slettingskontroller eller om opplastede opptak brukes til andre formål. Disse ukjente kan påvirke adopsjonen vesentlig, spesielt for sensitive opptak eller høyvolumstjenester.
Til slutt vil forholdet mellom denne modellen og Googles andre lydverktøy ha betydning. Dokumentasjonen leder sanntidsbrukere til en egen Live-transkripsjonsbane, mens bredere lydanalyse tilhører lydforståelse og stemmegenerering tilhører tekst-til-tale. Denne inndelingen kan gi utviklere klarere grensesnitt, men det kan også kreve separate integrasjoner for live-opptak, transkripsjon, analyse og syntese. Ytterligere utgivelsesnotater, prisdetaljer, uavhengige evalueringer og bevis på bruk i konsekvente innstillinger vil vise om Gemini 3.5 Transcribe er mer enn en velspesifisert API-funksjon.