Какво стана
Gemini API документацията на Google описва Gemini 3.5 Transcribe, модел за преобразуване на реч в текст за качени аудио файлове. Страницата предоставя подробности за изпълнението за дословна и интелигентна транскрипция, автоматично откриване на език в повече от 85 локализации, персонализиран речник, дневник на говорещия и времеви клейма на ниво дума.
Страницата на Google казва, че Gemini API преобразува качените аудио файлове в текст с модела Gemini 3.5 Transcribe, идентифициран като gemini-3.5-transcribe. Документираният работен процес е да качите аудио файл през Files API, да прехвърлите неговия URI към Interactions API и да прочетете върнатия препис от interakcijа.output_text. Страницата включва примери за Python, JavaScript и REST. За разпознаване в реално време с ниска латентност от микрофон или аудио поток на живо, Google насочва разработчиците към отделен Live API модел, наречен gemini-3.5-transcribe-live.
Моделът е документиран като поддържащ автоматично разпознаване на език в повече от 85 локализации, включително множество разновидности на английски, испански, португалски, бенгалски, пенджабски и китайски. Google казва, че моделът може да превключва динамично езиците, когато говорителите превключват кода в рамките на или между изреченията. Вместо това разработчиците могат да предоставят езикови кодове BCP-47, когато езикът е известен. Страницата също така описва персонализиран речник: могат да бъдат предоставени до 1000 фрази за разпознаване на пристрастия към специализирани термини, акроними, имена на марки и собствени съществителни, въпреки че Google казва, че най-добрите резултати обикновено идват от използването на до 100 термина.
Страницата описва два режима на транскрипция. Дословният режим е по подразбиране и има за цел да запази казаното, включително допълнителни думи, повторения, паузи и фалстартове. Интелигентният режим прилага последваща обработка, която премахва неточностите, разрешава изговорените самокорекции, добавя препинателни знаци и малки букви на изреченията и форматира изговорения материал в абзаци, списъци, дати, валути и числа. Примерът на Google променя устна корекция от „вторник, всъщност не, сряда“ в изчистена среща в сряда. Интелигентният режим не може да се комбинира с диария на говорещия или времеви клеймца на ниво дума.
Google също документира диаризацията на говорещия и времето на ниво дума като опции в дословния режим. Diarization етикетира различни гласове с идентификатори като spk_1 и spk_2, поддържащи до осем високоговорителя; приписването на трима или повече говорители е описано като експериментално. Времевите клейма на ниво дума връщат начални и крайни отмествания за разпознати думи, но Google предупреждава, че разрешаването им може да намали общата точност на транскрипцията. Стандартните унарни заявки поддържат аудио файлове до един час, докато обработката на аудио е ограничена до 30 минути, когато са активирани диаризация или времеви клейма на ниво дума. Страницата е последно актуализирана на 27 август 2026 г. и препраща разработчиците другаде за ценообразуване, лимити за токени и подробности за управление на файлове.
Детайли за източника: ai.google.dev ↗
Защо има значение
Документацията превръща предварително обявените възможности на модела в по-действена спецификация за разработчиците, изграждащи работни процеси за транскрипция. Той също така изяснява, че точността и функционалността включват компромиси: интелигентната транскрипция не може да предостави етикети на високоговорителите или времеви клейма, докато времевите клейма могат да намалят общата точност на транскрипцията.
Практическото значение е, че Google представя транскрипцията като конфигурируем модел на работен процес, а не като единична недиференцирана крайна точка за разпознаване на реч. Разработчикът може да избере буквален изход за записи или анализ или изчистен изход за четене. Езиковите съвети и персонализираният речник предлагат допълнителни контроли за специализирани записи. Тези контроли биха могли да намалят ръчното почистване и корекция в някои работни потоци, но източникът не предоставя сравнителни измервания на точността или доказателства от производствени внедрявания.
Етикетирането на високоговорителите и синхронизирането на ниво дума са особено подходящи за приложения, които трябва да навигират в запис, вместо просто да създават блок от текст. Етикетите могат да разделят завоите в запис с няколко високоговорителя, а отместванията могат да поддържат търсене или синхронизиране с аудио. Етикетите обаче идентифицират различни гласове, а не посочени хора, а Google изрично маркира приписването на трима или повече говорители като експериментално. Препис с времеви клейма може също да е по-малко точен като цяло според предупреждението в документацията, създавайки компромис между навигация и вярност.
Езиковата поддръжка, описана на страницата, може да има значение за многоезични срещи, интервюта, записи за обслужване на клиенти и други разговори, в които говорещите сменят езиците. Автоматичното откриване намалява необходимостта от конфигуриране на всеки запис предварително, докато изричните езикови кодове могат да подобрят резултатите, когато езикът е известен. Все пак източникът установява заявената поддръжка и поведение на Google, а не еднакво представяне във всички изброени локали, акценти, условия на шум или модели за превключване на кодове. Неговото позоваване на различни акценти и фонов шум е претенция за възможност, а не предоставен еталон.
Документираните ограничения също засягат дизайна на системата. Дългите записи може да изискват обработка на качване на файл, а добавянето на времеви клейма или дневник намалява посочения таван за обработка от един час на 30 минути. Интелигентната транскрипция може да е по-лесна за читателите, но е неподходяща, когато се изисква точна формулировка, приписване на говорителя или време. Страницата също така разделя транскрипцията от по-широките аудио отговори на въпроси и от синтеза на текст към реч, така че разработчиците не могат да приемат, че този модел е общ аудио анализ или система за генериране на глас. Ценообразуването, лимитите на токените, условията за поверителност и практиките за задържане остават извън предоставената тук информация.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Какво да гледате след това
Важните следващи въпроси са производителността в записите в реалния свят, ценообразуването, лимитите на токените, обработката на данни и наличността. Google не предоставя сравнителни резултати, условия за задържане, ангажименти за ниво на обслужване или подробни цени на тази страница, така че документацията установява възможности и ограничения, а не независимо проверено качество.
Първият приоритет за проверка е качеството на транскрипцията в реалния свят. Независимото тестване ще трябва да изследва акценти, припокриваща се реч, фонов шум, записи с ниско качество, многоезично превключване на кодове и специализирана терминология в изброените локали. Той трябва да сравнява дословни и интелигентни резултати, особено когато интелигентният режим премахва пълнители или разрешава корекции, които може да са важни за оригиналното значение. Документацията не дава процент на грешка в думата, резултати за език по език или примери от неконтролирани записи.
Приписването на говорител заслужава отделно разглеждане. Google поддържа до осем високоговорителя, но приписването на три или повече е експериментално. Тестовете трябва да измерват колко често системата разделя един говорител на множество етикети, обединява различни говорители или присвоява думи на грешен човек. Подобно тестване е необходимо за времеви клейма на думи, тъй като страницата предупреждава, че времевите клейма могат да влошат общата точност на транскрипцията. Тези компромиси са последователни за преписи от интервюта, инструменти за достъпност, архиви с възможност за търсене и всеки работен процес, който третира изхода като запис.
Разработчиците и организациите също трябва да следят оперативните условия, които тази страница не уточнява. Google насочва читателите към страница за ценообразуване за ценообразуване на модела и лимити на токени, но тези цифри не са включени в източника. Страницата също така не посочва регионална наличност, ангажименти на ниво услуга, поддържани аудио формати в изчерпателен списък, периоди на задържане, контроли за изтриване или дали качените записи се използват за други цели. Тези неизвестни биха могли съществено да повлияят на приемането, особено за чувствителни записи или услуги с голям обем.
И накрая, връзката между този модел и другите аудио инструменти на Google ще има значение. Документацията насочва потребителите в реално време към отделна пътека за транскрипция на живо, докато по-широкият аудио анализ принадлежи към разбирането на звука, а генерирането на глас принадлежи към текст-към-говор. Това разделение може да даде на разработчиците по-ясни интерфейси, но също така може да изисква отделни интеграции за улавяне на живо, транскрипция, анализ и синтез. Допълнителни бележки за изданието, подробности за ценообразуването, независими оценки и доказателства за използване в последващи настройки ще покажат дали Gemini 3.5 Transcribe е нещо повече от добре определена API способност.