PRZEWODNIK AI audio

Przemówienie NVIDIA Riva i NeMo

NVIDIA Riva to akcelerowany przez GPU pakiet SDK do produkcyjnej sztucznej inteligencji mowy (ASR, TTS i tłumaczenie), natomiast NeMo to zestaw narzędzi typu open source do szkolenia i dostrajania podstawowych modeli.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Together they let developers build fast, customizable voice applications that run on NVIDIA hardware.

Głębokie nurkowanie

NeMo (Neural Modules) to platforma PyTorch typu open source firmy NVIDIA do tworzenia konwersacyjnej sztucznej inteligencji. Zawiera wstępnie wytrenowane modele automatycznego rozpoznawania mowy (ASR), zamiany tekstu na mowę (TTS) i zadań związanych z językiem naturalnym, zorganizowane jako „moduły neuronowe” wielokrotnego użytku, które można dostroić na podstawie własnych danych. Riva zajmuje się wdrażaniem: pakuje zoptymalizowane modele za serwerem przesyłania strumieniowego gRPC, korzystając z TensorRT i serwera wnioskowania Triton, aby osiągnąć niskie opóźnienia na dużą skalę. Typowy przepływ pracy szkoli lub dostosowuje model w NeMo, eksportuje go do formatu Riva, a następnie udostępnia do transkrypcji lub syntezy w czasie rzeczywistym. Riva obsługuje rozpoznawanie transmisji strumieniowej za pomocą znaczników czasu na poziomie słów, neuronowych głosów TTS, diaaryzacji głośników i wielu języków, a wszystko to dostrojone do wydajnej pracy na procesorach graficznych NVIDIA.

Wgląd techniczny

Szybkość Rivy wynika z kompilowania modeli za pomocą TensorRT i udostępniania ich przez Triton, który łączy jądra, stosuje mieszaną precyzję (FP16/INT8) i dynamicznie grupuje współbieżne żądania. Modele ASR, takie jak Conformer-CTC lub Parakeet, przesyłają strumieniowo dźwięk w małych porcjach, zachowując kontekst, tworząc częściowe transkrypcje w ciągu kilkudziesięciu milisekund. Potoki TTS łączą model akustyczny (np. FastPitch) z wokoderem neuronowym (np. HiFi-GAN) w celu generowania przebiegów szybciej niż w czasie rzeczywistym na pojedynczym procesorze graficznym.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość NVIDIA Riva i NeMo Speech

NVIDIA naciska na Rivę i NeMo w kierunku większych, bardziej wielojęzycznych podstawowych modeli mowy i ściślejszej integracji z agentami opartymi na LLM w celu uzyskania kompleksowych asystentów głosowych. Oczekuj bogatszego dostosowywania (wzmacnianie słów, niestandardowe głosy z minut danych), lepszej odporności na hałaśliwe środowisko i wdrażania obejmującego procesory graficzne w centrach danych po urządzenia brzegowe, takie jak Jetson. W miarę ewolucji NeMo wraz z modelami generatywnymi granica między rozpoznawaniem mowy, tłumaczeniem i rozumowaniem konwersacyjnym będzie nadal się zacierać i przekształcać w ujednolicone potoki czasu rzeczywistego.

Implementacja w świecie rzeczywistym

Transkrypcja call center w czasie rzeczywistym i pomoc agenta na żywo, która podpisuje rozmowy z klientami za pomocą znaczników czasu na poziomie słów

Tworzenie niestandardowych, markowych głosów TTS dla wirtualnego asystenta poprzez dostrajanie FastPitch w NeMo na kilku godzinach nagrań

Napisy na żywo i tłumaczenie mowy podczas wideokonferencji lub transmisji strumieniowych na procesorach graficznych NVIDIA

Dopracowanie modelu Conformer ASR w oparciu o słownictwo medyczne lub prawnicze specyficzne dla danej domeny przy użyciu NeMo, a następnie udostępnienie go za pośrednictwem Riva

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NVIDIA Riva and NeMo Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Wskaźniki jakości mowy PESQ i STOI

Często zadawane pytania

What is NVIDIA Riva and NeMo Speech?

NVIDIA Riva to akcelerowany przez GPU pakiet SDK do produkcyjnej sztucznej inteligencji mowy (ASR, TTS i tłumaczenie), natomiast NeMo to zestaw narzędzi typu open source do szkolenia i dostrajania podstawowych modeli. Razem pozwalają programistom tworzyć szybkie, konfigurowalne aplikacje głosowe działające na sprzęcie NVIDIA.

Jaka jest podstawowa różnica między NeMo i Rivą?

NeMo to zestaw narzędzi typu open source do budowania i dostrajania modeli mowy i języka, podczas gdy Riva pakuje i udostępnia te modele do użytku produkcyjnego z niskimi opóźnieniami.

Na jakich dwóch technologiach NVIDIA opiera się Riva, aby osiągnąć wnioskowanie o niskim opóźnieniu?

Riva kompiluje modele za pomocą TensorRT w celu zoptymalizowania wykonania procesora graficznego i udostępnia je za pośrednictwem serwera Triton Inference Server, który obsługuje dynamiczne przetwarzanie wsadowe i współbieżność.

Jaka jest rola wokodera takiego jak HiFi-GAN w typowym rurociągu Riva TTS?

Model akustyczny, taki jak FastPitch, przewiduje cechy spektrogramu na podstawie tekstu, a wokoder neuronowy, taki jak HiFi-GAN, przekształca te cechy w ostateczny kształt fali dźwiękowej.

Co umożliwia „streaming” ASR w Riva?

Rozpoznawanie strumieniowe przetwarza dźwięk w małych porcjach i emituje częściowe wyniki w czasie zbliżonym do rzeczywistego, zamiast czekać na zakończenie całej wypowiedzi.

Jaki jest przykład dostosowywania, które NeMo umożliwia w przypadku modeli mowy?

NeMo umożliwia programistom dostrajanie wstępnie wyszkolonych modeli na podstawie własnych danych, na przykład dostosowując model ASR do rozpoznawania specjalistycznej terminologii medycznej lub prawnej.