PRZEWODNIK AI audio

OpenAI Szept

Whisper to system automatycznego rozpoznawania mowy typu open source firmy OpenAI, który transkrybuje i tłumaczy dźwięk mówiony na dziesiątki języków.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Ma to znaczenie, ponieważ zapewnia solidną, swobodną, ​​niemal ludzką transkrypcję każdemu, kto może uruchomić model.

Głębokie nurkowanie

Wydany we wrześniu 2022 r. program Whisper został przeszkolony na podstawie około 680 000 godzin wielojęzycznego, wielozadaniowego materiału audio zebranego z Internetu. Sekretem jego solidności jest ogromny i zróżnicowany zbiór danych: znacznie lepiej radzi sobie z akcentami, szumami tła i żargonem technicznym niż starsze systemy, bez konieczności dostrajania go pod kątem każdej nowej domeny. Whisper może transkrybować mowę w języku oryginalnym, tłumaczyć mowę z wielu języków na angielski, identyfikować język mówiony i dodawać znaczniki czasu. OpenAI udostępnił wagi modelu i kod w sposób otwarty, dzięki czemu działa lokalnie na laptopie lub w centrum danych, co doprowadziło do eksplozji narzędzi społecznościowych, szybszych reimplementacji i aplikacji zbudowanych na ich bazie. Dokładność różni się w zależności od języka i jakości dźwięku i, jak wszystkie tego typu systemy, może czasami powodować „halucynacje” tekstu.

Wgląd techniczny

Whisper to koder-dekoder Transformera przeszkolony jako zadanie sekwencja po sekwencji. Dźwięk jest konwertowany na spektrogram log-Mel, wizualną reprezentację częstotliwości w czasie, przetwarzaną przez koder. Następnie dekoder przewiduje tokeny tekstowe, uwarunkowane specjalnymi tokenami, które informują model, jakie zadanie ma wykonać: transkrypcja, tłumaczenie, wykrycie języka lub dodanie znaczników czasu. Ponieważ nauczył się na podstawie słabo oznakowanego dźwięku internetowego w wielu zadaniach jednocześnie, pojedynczy model uogólnia, zamiast dostrajać do jednego wąskiego punktu odniesienia.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość OpenAI Szeptu

Szept stał się domyślnym elementem transkrypcji, a trend zmierza w kierunku szybszych, mniejszych wariantów działających w czasie rzeczywistym, które działają na telefonach i urządzeniach brzegowych. Spodziewaj się lepszej obsługi transmisji strumieniowej, lepszej separacji głośników i integracji z modelami o dużych językach w celu czyszczenia, podsumowywania i napisów na żywo. Otwarte wagi oznaczają, że społeczność stale je optymalizuje, podczas gdy OpenAI i inni promują nowsze modele mowy. Aktywnym priorytetem pozostaje ograniczenie halucynacyjnych tekstów, szczególnie w zastosowaniach medycznych i prawnych.

Implementacja w świecie rzeczywistym

Dziennikarz automatycznie transkrybuje nagrane wywiady, zamiast przepisywać je ręcznie

Platforma podcastów generuje transkrypcje i napisy do każdego odcinka z możliwością przeszukiwania

Narzędzie do spotkań tworzy napisy na żywo i pisemny zapis rozmowy wideo

Badacz tłumaczy nagrania terenowe w języku mówionym na tekst angielski w celu analizy

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the OpenAI Whisper quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Wyrównanie słów ze znacznikiem czasu szeptanym

Często zadawane pytania

Co to jest szept OpenAI?

Whisper to system automatycznego rozpoznawania mowy typu open source firmy OpenAI, który transkrybuje i tłumaczy dźwięk mówiony na dziesiątki języków. Ma to znaczenie, ponieważ zapewnia solidną, swobodną, ​​niemal ludzką transkrypcję każdemu, kto potrafi uruchomić model.

Jaki jest główny cel Szeptu OpenAI?

Whisper to automatyczny system rozpoznawania mowy, który transkrybuje i tłumaczy dźwięk mówiony na wiele języków.

Mniej więcej, na jakim poziomie dźwięku trenowano Whisper?

Whisper został przeszkolony na podstawie około 680 000 godzin wielojęzycznego, wielozadaniowego materiału audio pobranego z Internetu, co zapewnia jego solidność.

Jaką reprezentację dźwięku przetwarza koder Whisper?

Dźwięk jest konwertowany na spektrogram log-Mel, reprezentację zawartości częstotliwości w czasie, którą odczytuje koder Transformera.

Jakich możliwości Whisper NIE zapewnia natywnie?

Whisper obsługuje transkrypcję, tłumaczenie na angielski, wykrywanie języka i znaczniki czasu, ale nie jest generatorem wideo.

Dlaczego Whisper wywołał falę narzędzi i aplikacji społecznościowych?

Ponieważ OpenAI udostępnił wagi i kod na zasadach open source, programiści mogli uruchamiać Whisper lokalnie i tworzyć wiele narzędzi oraz szybciej reimplementować.