OpenAI Szept
Whisper to system automatycznego rozpoznawania mowy typu open source firmy OpenAI, który transkrybuje i tłumaczy dźwięk mówiony na dziesiątki języków.
Przegląd
Ma to znaczenie, ponieważ zapewnia solidną, swobodną, niemal ludzką transkrypcję każdemu, kto może uruchomić model.
Głębokie nurkowanie
Wydany we wrześniu 2022 r. program Whisper został przeszkolony na podstawie około 680 000 godzin wielojęzycznego, wielozadaniowego materiału audio zebranego z Internetu. Sekretem jego solidności jest ogromny i zróżnicowany zbiór danych: znacznie lepiej radzi sobie z akcentami, szumami tła i żargonem technicznym niż starsze systemy, bez konieczności dostrajania go pod kątem każdej nowej domeny. Whisper może transkrybować mowę w języku oryginalnym, tłumaczyć mowę z wielu języków na angielski, identyfikować język mówiony i dodawać znaczniki czasu. OpenAI udostępnił wagi modelu i kod w sposób otwarty, dzięki czemu działa lokalnie na laptopie lub w centrum danych, co doprowadziło do eksplozji narzędzi społecznościowych, szybszych reimplementacji i aplikacji zbudowanych na ich bazie. Dokładność różni się w zależności od języka i jakości dźwięku i, jak wszystkie tego typu systemy, może czasami powodować „halucynacje” tekstu.
Wgląd techniczny
Whisper to koder-dekoder Transformera przeszkolony jako zadanie sekwencja po sekwencji. Dźwięk jest konwertowany na spektrogram log-Mel, wizualną reprezentację częstotliwości w czasie, przetwarzaną przez koder. Następnie dekoder przewiduje tokeny tekstowe, uwarunkowane specjalnymi tokenami, które informują model, jakie zadanie ma wykonać: transkrypcja, tłumaczenie, wykrycie języka lub dodanie znaczników czasu. Ponieważ nauczył się na podstawie słabo oznakowanego dźwięku internetowego w wielu zadaniach jednocześnie, pojedynczy model uogólnia, zamiast dostrajać do jednego wąskiego punktu odniesienia.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość OpenAI Szeptu
Szept stał się domyślnym elementem transkrypcji, a trend zmierza w kierunku szybszych, mniejszych wariantów działających w czasie rzeczywistym, które działają na telefonach i urządzeniach brzegowych. Spodziewaj się lepszej obsługi transmisji strumieniowej, lepszej separacji głośników i integracji z modelami o dużych językach w celu czyszczenia, podsumowywania i napisów na żywo. Otwarte wagi oznaczają, że społeczność stale je optymalizuje, podczas gdy OpenAI i inni promują nowsze modele mowy. Aktywnym priorytetem pozostaje ograniczenie halucynacyjnych tekstów, szczególnie w zastosowaniach medycznych i prawnych.
Implementacja w świecie rzeczywistym
Dziennikarz automatycznie transkrybuje nagrane wywiady, zamiast przepisywać je ręcznie
Platforma podcastów generuje transkrypcje i napisy do każdego odcinka z możliwością przeszukiwania
Narzędzie do spotkań tworzy napisy na żywo i pisemny zapis rozmowy wideo
Badacz tłumaczy nagrania terenowe w języku mówionym na tekst angielski w celu analizy
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the OpenAI Whisper quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Wyrównanie słów ze znacznikiem czasu szeptanym
Często zadawane pytania
Co to jest szept OpenAI?
Whisper to system automatycznego rozpoznawania mowy typu open source firmy OpenAI, który transkrybuje i tłumaczy dźwięk mówiony na dziesiątki języków. Ma to znaczenie, ponieważ zapewnia solidną, swobodną, niemal ludzką transkrypcję każdemu, kto potrafi uruchomić model.
Jaki jest główny cel Szeptu OpenAI?
Whisper to automatyczny system rozpoznawania mowy, który transkrybuje i tłumaczy dźwięk mówiony na wiele języków.
Mniej więcej, na jakim poziomie dźwięku trenowano Whisper?
Whisper został przeszkolony na podstawie około 680 000 godzin wielojęzycznego, wielozadaniowego materiału audio pobranego z Internetu, co zapewnia jego solidność.
Jaką reprezentację dźwięku przetwarza koder Whisper?
Dźwięk jest konwertowany na spektrogram log-Mel, reprezentację zawartości częstotliwości w czasie, którą odczytuje koder Transformera.
Jakich możliwości Whisper NIE zapewnia natywnie?
Whisper obsługuje transkrypcję, tłumaczenie na angielski, wykrywanie języka i znaczniki czasu, ale nie jest generatorem wideo.
Dlaczego Whisper wywołał falę narzędzi i aplikacji społecznościowych?
Ponieważ OpenAI udostępnił wagi i kod na zasadach open source, programiści mogli uruchamiać Whisper lokalnie i tworzyć wiele narzędzi oraz szybciej reimplementować.