Назад към Новини
ПродуктAI Understanding брифинг

Gemini 3.5 Документи за транскрибиране на Google описват режимите и ограниченията за преобразуване на реч в текст

Документацията за разработчици на Google описва подробно как Gemini 3.5 Transcribe обработва аудио файлове, включително автоматично откриване на език, етикетиране на високоговорителите, времеви клейма на думи и изчистени „интелигентни“ преписи. Страницата също така документира практически ограничения, включително по-кратка максимална продължителност на звука, когато дневникът или времевите клейма са...

6 min readRead the linked source
Source-provided image accompanying Google’s Gemini 3.5 Transcribe docs spell out speech-to-text modes and limits
ИзточникИзточникът е записан
Издател
ai.google.dev
Изходна връзка
ai.google.devhttps://ai.google.dev/gemini-api/docs/transcribe
Тип източник
Свързан източник — статусът на първичен източник не е установен.
Също цитирани

Историята е последно преработена

КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

API (интерфейс за програмиране на приложения)
Структуриран начин за една софтуерна система да изпраща заявки до и да получава отговори от друга система.
Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
Латентност
Времето между изпращането на заявка и получаването на изхода на модела.
Тествайте себе сиТест за обяснение на AI модели

Какво се промени от публикуването

  1. Първо публикувано
  2. The Verge значително подобрява продължаващото издание на Gemini 3.5 Transcribe, като отчита специфични възможности и подробности за внедряването: автоматично премахване на думи за пълнене, персонализиран речник, приписване за до трима говорители, времеви клейма на ниво дума, свързани актуализации на Gemini 3.5 на живо, наличност на macOS и избран Android и публичен достъп за предварителен преглед за разработчици. Тези подробности идват от доклада на The Verge и твърденията на Google, цитирани там; те не са независимо потвърдени в предоставения материал.
  3. Този доклад на Ars Technica съществено напредва в съществуващата актуализация на Gemini 3.5 Transcribe, като добавя докладваните показатели за производителност на Google, поддръжка за 85 езика и до трима високоговорителя в предварително записано аудио, персонализирана поддръжка на речник и по-широко разпространение в macOS, Antigravity, AI Studio, Gemini API и планирана интеграция на Chrome.
  4. Актуализираната първична документация на Google съществено разширява по-ранното съобщение за транскрибиране на Gemini 3.5 с API примери, два режима на транскрипция, поддръжка за повече от 85 локализации, до 1000 персонализирани речникови фрази, до осем етикета на високоговорителя, времеви клейма на ниво дума и изрични ограничения за продължителност и съвместимост.

Какво стана

Gemini API документацията на Google описва Gemini 3.5 Transcribe, модел за преобразуване на реч в текст за качени аудио файлове. Страницата предоставя подробности за изпълнението за дословна и интелигентна транскрипция, автоматично откриване на език в повече от 85 локализации, персонализиран речник, дневник на говорещия и времеви клейма на ниво дума.

Страницата на Google казва, че Gemini API преобразува качените аудио файлове в текст с модела Gemini 3.5 Transcribe, идентифициран като gemini-3.5-transcribe. Документираният работен процес е да качите аудио файл през Files API, да прехвърлите неговия URI към Interactions API и да прочетете върнатия препис от interakcijа.output_text. Страницата включва примери за Python, JavaScript и REST. За разпознаване в реално време с ниска латентност от микрофон или аудио поток на живо, Google насочва разработчиците към отделен Live API модел, наречен gemini-3.5-transcribe-live.

Моделът е документиран като поддържащ автоматично разпознаване на език в повече от 85 локализации, включително множество разновидности на английски, испански, португалски, бенгалски, пенджабски и китайски. Google казва, че моделът може да превключва динамично езиците, когато говорителите превключват кода в рамките на или между изреченията. Вместо това разработчиците могат да предоставят езикови кодове BCP-47, когато езикът е известен. Страницата също така описва персонализиран речник: могат да бъдат предоставени до 1000 фрази за разпознаване на пристрастия към специализирани термини, акроними, имена на марки и собствени съществителни, въпреки че Google казва, че най-добрите резултати обикновено идват от използването на до 100 термина.

Страницата описва два режима на транскрипция. Дословният режим е по подразбиране и има за цел да запази казаното, включително допълнителни думи, повторения, паузи и фалстартове. Интелигентният режим прилага последваща обработка, която премахва неточностите, разрешава изговорените самокорекции, добавя препинателни знаци и малки букви на изреченията и форматира изговорения материал в абзаци, списъци, дати, валути и числа. Примерът на Google променя устна корекция от „вторник, всъщност не, сряда“ в изчистена среща в сряда. Интелигентният режим не може да се комбинира с диария на говорещия или времеви клеймца на ниво дума.

Google също документира диаризацията на говорещия и времето на ниво дума като опции в дословния режим. Diarization етикетира различни гласове с идентификатори като spk_1 и spk_2, поддържащи до осем високоговорителя; приписването на трима или повече говорители е описано като експериментално. Времевите клейма на ниво дума връщат начални и крайни отмествания за разпознати думи, но Google предупреждава, че разрешаването им може да намали общата точност на транскрипцията. Стандартните унарни заявки поддържат аудио файлове до един час, докато обработката на аудио е ограничена до 30 минути, когато са активирани диаризация или времеви клейма на ниво дума. Страницата е последно актуализирана на 27 август 2026 г. и препраща разработчиците другаде за ценообразуване, лимити за токени и подробности за управление на файлове.

Детайли за източника: ai.google.dev ↗

Защо има значение

Документацията превръща предварително обявените възможности на модела в по-действена спецификация за разработчиците, изграждащи работни процеси за транскрипция. Той също така изяснява, че точността и функционалността включват компромиси: интелигентната транскрипция не може да предостави етикети на високоговорителите или времеви клейма, докато времевите клейма могат да намалят общата точност на транскрипцията.

Практическото значение е, че Google представя транскрипцията като конфигурируем модел на работен процес, а не като единична недиференцирана крайна точка за разпознаване на реч. Разработчикът може да избере буквален изход за записи или анализ или изчистен изход за четене. Езиковите съвети и персонализираният речник предлагат допълнителни контроли за специализирани записи. Тези контроли биха могли да намалят ръчното почистване и корекция в някои работни потоци, но източникът не предоставя сравнителни измервания на точността или доказателства от производствени внедрявания.

Етикетирането на високоговорителите и синхронизирането на ниво дума са особено подходящи за приложения, които трябва да навигират в запис, вместо просто да създават блок от текст. Етикетите могат да разделят завоите в запис с няколко високоговорителя, а отместванията могат да поддържат търсене или синхронизиране с аудио. Етикетите обаче идентифицират различни гласове, а не посочени хора, а Google изрично маркира приписването на трима или повече говорители като експериментално. Препис с времеви клейма може също да е по-малко точен като цяло според предупреждението в документацията, създавайки компромис между навигация и вярност.

Езиковата поддръжка, описана на страницата, може да има значение за многоезични срещи, интервюта, записи за обслужване на клиенти и други разговори, в които говорещите сменят езиците. Автоматичното откриване намалява необходимостта от конфигуриране на всеки запис предварително, докато изричните езикови кодове могат да подобрят резултатите, когато езикът е известен. Все пак източникът установява заявената поддръжка и поведение на Google, а не еднакво представяне във всички изброени локали, акценти, условия на шум или модели за превключване на кодове. Неговото позоваване на различни акценти и фонов шум е претенция за възможност, а не предоставен еталон.

Документираните ограничения също засягат дизайна на системата. Дългите записи може да изискват обработка на качване на файл, а добавянето на времеви клейма или дневник намалява посочения таван за обработка от един час на 30 минути. Интелигентната транскрипция може да е по-лесна за читателите, но е неподходяща, когато се изисква точна формулировка, приписване на говорителя или време. Страницата също така разделя транскрипцията от по-широките аудио отговори на въпроси и от синтеза на текст към реч, така че разработчиците не могат да приемат, че този модел е общ аудио анализ или система за генериране на глас. Ценообразуването, лимитите на токените, условията за поверителност и практиките за задържане остават извън предоставената тук информация.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивна проверка на концепцията+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Какво да гледате след това

Важните следващи въпроси са производителността в записите в реалния свят, ценообразуването, лимитите на токените, обработката на данни и наличността. Google не предоставя сравнителни резултати, условия за задържане, ангажименти за ниво на обслужване или подробни цени на тази страница, така че документацията установява възможности и ограничения, а не независимо проверено качество.

Първият приоритет за проверка е качеството на транскрипцията в реалния свят. Независимото тестване ще трябва да изследва акценти, припокриваща се реч, фонов шум, записи с ниско качество, многоезично превключване на кодове и специализирана терминология в изброените локали. Той трябва да сравнява дословни и интелигентни резултати, особено когато интелигентният режим премахва пълнители или разрешава корекции, които може да са важни за оригиналното значение. Документацията не дава процент на грешка в думата, резултати за език по език или примери от неконтролирани записи.

Приписването на говорител заслужава отделно разглеждане. Google поддържа до осем високоговорителя, но приписването на три или повече е експериментално. Тестовете трябва да измерват колко често системата разделя един говорител на множество етикети, обединява различни говорители или присвоява думи на грешен човек. Подобно тестване е необходимо за времеви клейма на думи, тъй като страницата предупреждава, че времевите клейма могат да влошат общата точност на транскрипцията. Тези компромиси са последователни за преписи от интервюта, инструменти за достъпност, архиви с възможност за търсене и всеки работен процес, който третира изхода като запис.

Разработчиците и организациите също трябва да следят оперативните условия, които тази страница не уточнява. Google насочва читателите към страница за ценообразуване за ценообразуване на модела и лимити на токени, но тези цифри не са включени в източника. Страницата също така не посочва регионална наличност, ангажименти на ниво услуга, поддържани аудио формати в изчерпателен списък, периоди на задържане, контроли за изтриване или дали качените записи се използват за други цели. Тези неизвестни биха могли съществено да повлияят на приемането, особено за чувствителни записи или услуги с голям обем.

И накрая, връзката между този модел и другите аудио инструменти на Google ще има значение. Документацията насочва потребителите в реално време към отделна пътека за транскрипция на живо, докато по-широкият аудио анализ принадлежи към разбирането на звука, а генерирането на глас принадлежи към текст-към-говор. Това разделение може да даде на разработчиците по-ясни интерфейси, но също така може да изисква отделни интеграции за улавяне на живо, транскрипция, анализ и синтез. Допълнителни бележки за изданието, подробности за ценообразуването, независими оценки и доказателства за използване в последващи настройки ще покажат дали Gemini 3.5 Transcribe е нещо повече от добре определена API способност.

Свързани ръководства и викторини

Обяснени модели на AIЕтика на ИИAI обучениеТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел

Актуализации и корекции

Тази канонична история се актуализира на място, когато развиващото се събитие се промени съществено. Неговият URL адрес и оригиналната дата на публикуване никога не се променят.

  • Актуализираната първична документация на Google съществено разширява по-ранното съобщение за транскрибиране на Gemini 3.5 с API примери, два режима на транскрипция, поддръжка за повече от 85 локализации, до 1000 персонализирани речникови фрази, до осем етикета на високоговорителя, времеви клейма на ниво дума и изрични ограничения за продължителност и съвместимост.
  • Този доклад на Ars Technica съществено напредва в съществуващата актуализация на Gemini 3.5 Transcribe, като добавя докладваните показатели за производителност на Google, поддръжка за 85 езика и до трима високоговорителя в предварително записано аудио, персонализирана поддръжка на речник и по-широко разпространение в macOS, Antigravity, AI Studio, Gemini API и планирана интеграция на Chrome.
  • The Verge значително подобрява продължаващото издание на Gemini 3.5 Transcribe, като отчита специфични възможности и подробности за внедряването: автоматично премахване на думи за пълнене, персонализиран речник, приписване за до трима говорители, времеви клейма на ниво дума, свързани актуализации на Gemini 3.5 на живо, наличност на macOS и избран Android и публичен достъп за предварителен преглед за разработчици. Тези подробности идват от доклада на The Verge и твърденията на Google, цитирани там; те не са независимо потвърдени в предоставения материал.
Вижте дневника на публичните корекции
Намирате ли това за полезно?