Zvukový průvodce AI

Šeptání Rozpoznávání řeči

Whisper je otevřený systém automatického rozpoznávání řeči společnosti OpenAI, který převádí zvuk na text ve více než 90 jazycích.

2 minuty čteníNaposledy aktualizováno

Přehled

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

Hluboký ponor

Whisper, vydaný OpenAI v září 2022, je model kodéru a dekodéru založený na Transformeru, který byl trénován na 680 000 hodinách vícejazyčného multitaskového zvuku staženého z webu. Na rozdíl od dřívějších systémů, které potřebovaly čistá, označená data, se Whisper učil z chaotických nahrávek v reálném světě, díky čemuž byl pozoruhodně odolný vůči akcentům, šumu a přeslechům. Jediný model se stará o přepis, překlad do angličtiny, identifikaci jazyka a časové razítko. Dodává se ve velikostech od „malých“ (parametry 39 milionů) po „velké“ (1,55 B), což uživatelům umožňuje měnit rychlost za přesnost. Protože váhy jsou otevřeně licencovány pod MIT, Whisper se téměř přes noc stal výchozí páteří pro nespočet přepisovačů podcastů, nástrojů pro titulky a hlasových aplikací.

Technický přehled

Whisper rozdělí zvuk na 30sekundové části, každý převede na log-Mel spektrogram (80 frekvenčních kanálů) a přivede jej do kodéru Transformer. Dekodér pak předpovídá textové tokeny autoregresivně, řízeně pomocí speciálních tokenů, které specifikují úkol (přepis vs. překlad), jazyk a zda se mají vysílat časová razítka. Toto víceúlohové kondicionování tokenů je chytrý trik: jedna sada závaží provádí mnoho úloh v závislosti na výzvových tokenech dodaných na začátku dekódování.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost rozpoznávání řeči šepotem

Whisper vyvolal vlnu rychlejších derivátů, jako je Whisper.cpp, rychlejší whisper a destilované verze, které běží v reálném čase na telefonech a noteboocích. Očekávejte přísnější varianty streamování (s nízkou latencí), lepší diarizaci mluvčího a vyšší výkon v jazycích s nízkými zdroji. Jak roste umělá inteligence pro zvuk v zařízení, lehké modely ve stylu Whisper budou pravděpodobně využívat živé titulky, poznámky ze schůzek a nástroje pro usnadnění zcela offline, přičemž zachovají soukromí a zároveň budou odpovídat přesnosti na úrovni cloudu.

Real-World Implementace

Automatické generování prohledávatelných přepisů a titulků pro podcasty a videa na YouTube

Napájení aplikací pro živé poznámky ze schůzek, které vytvářejí souhrny ze zvuku Zoom nebo Teams

Překlad cizojazyčných rozhovorů přímo do anglického textu pro novináře

Vytváření hlasem ovládaných nástrojů pro usnadnění a diktování pro uživatele, kteří nemohou psát

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Rozpoznávání emocí řeči

Často kladené otázky

What is Whisper Speech Recognition?

Whisper je otevřený systém automatického rozpoznávání řeči společnosti OpenAI, který převádí zvuk na text ve více než 90 jazycích. Záleží na tom, protože to každému zdarma přineslo téměř lidskou kvalitu přepisu a robustně pracovalo na akcentech, šumu v pozadí a technickém žargonu.

Přibližně na kolika hodinách zvuku byl Whisper trénován?

Whisper byl trénován na přibližně 680 000 hodinách vícejazyčného multitaskového zvuku shromážděného z webu, což je neobvykle velký a rozmanitý soubor dat.

Jakou střední reprezentaci Whisper vypočítá z nezpracovaného zvuku před kodérem?

Whisper převádí každý 30sekundový audio blok na 80kanálový log-Mel spektrogram, který kodér Transformer zpracovává.

Jak jediný model Whisper provádí více úkolů, jako je přepis a překlad?

Na začátku dekódování zašeptejte podmínky na speciální tokeny, které mu sdělí jazyk, úkol a zda má vysílat časová razítka.

Jakou celkovou neuronovou architekturu Whisper používá?

Whisper je kodér-dekodér Transformer: kodér čte spektrogram a dekodér generuje textové tokeny autoregresivně.

Proč je Whisper považován za obzvláště robustní ve srovnání s dřívějšími systémy ASR?

Trénink na obrovském množství různorodého zvuku z reálného světa (akcenty, šum, přeslechy) poskytl Whisperu silnou robustnost bez ladění pro jednotlivé domény.