Audio AI Itọsọna

NVIDIA Riva ati NeMo Ọrọ

NVIDIA Riva jẹ SDK isare GPU fun iṣelọpọ ọrọ AI (ASR, TTS, ati itumọ), lakoko ti NeMo jẹ ohun elo irinṣẹ orisun-ìmọ fun ikẹkọ ati ṣiṣe atunṣe awọn awoṣe ti o wa labẹ.

2 min kakẹhin imudojuiwọn

Akopọ

Papọ wọn jẹ ki awọn olupilẹṣẹ kọ awọn ohun elo ohun ti o yara, ti o le ṣe asefara ti o nṣiṣẹ lori awọn ohun elo NVIDIA.

Jin Dive

NeMo (Neural Modules) jẹ ipilẹ-orisun PyTorch ti NVIDIA fun kikọ AI ibaraẹnisọrọ. O gbe awọn awoṣe ti a ti kọkọ tẹlẹ fun idanimọ ọrọ aifọwọyi (ASR), ọrọ-si-ọrọ (TTS), ati awọn iṣẹ ṣiṣe ede ti ẹda, ti a ṣeto bi ‘awọn modulu nkankikan’ ti o tun le lo o le ṣe atunṣe daradara lori data tirẹ. Riva jẹ ẹgbẹ imuṣiṣẹ: o ṣe akopọ awọn awoṣe iṣapeye lẹhin olupin gRPC ṣiṣanwọle, ni lilo TensorRT ati Triton Inference Server lati kọlu lairi kekere ni iwọn. Ṣiṣan iṣan-iṣẹ aṣoju kan ṣe ikẹkọ tabi ṣe adaṣe awoṣe kan ni NeMo, gbejade lọ si ọna kika Riva, lẹhinna ṣe iranṣẹ fun transcription akoko gidi tabi iṣelọpọ. Riva ṣe atilẹyin idanimọ ṣiṣanwọle pẹlu awọn ami akoko ipele-ọrọ, awọn ohun TTS neural, diarization agbọrọsọ, ati ọpọlọpọ awọn ede, gbogbo aifwy lati ṣiṣẹ daradara lori NVIDIA GPUs.

Imọ-imọ-ẹrọ

Iyara Riva wa lati ikojọpọ awọn awoṣe pẹlu TensorRT ati sìn wọn nipasẹ Triton, eyiti o dapọ awọn kernels, kan deede-konge (FP16/INT8), ati awọn ipele awọn ibeere nigbakanna ni agbara. Awọn awoṣe ASR bii Conformer-CTC tabi Parakeet ṣiṣan ṣiṣan ni awọn ṣoki kekere lakoko ti o n ṣetọju ọrọ-ọrọ, ṣiṣe awọn iwe afọwọkọ apakan laarin awọn mewa ti milliseconds. Awọn pipeline TTS so awoṣe akositiki pọ (fun apẹẹrẹ, FastPitch) pẹlu vocoder nkankikan (fun apẹẹrẹ, HiFi-GAN) lati ṣe agbekalẹ awọn igbi ni iyara ju akoko gidi lọ lori GPU kan.

Ipa Ilana

Wiwọle ati arọwọto

O ṣe ilọsiwaju iraye si nipasẹ transcription, alaye, ati awọn atọkun ohun.

Iye owo ati isuna

Awọn ẹgbẹ Media le firanṣẹ ohun didan yiyara pẹlu awọn isuna-owo kekere.

Iyara ati iwọn

Awọn ọna ṣiṣe ti nkọju si alabara le ṣe ilana awọn ibaraẹnisọrọ sisọ ni iwọn nla.

Ọjọ iwaju ti NVIDIA Riva ati Ọrọ NeMo

NVIDIA n titari Riva ati NeMo si ọna ti o tobi, awọn awoṣe ọrọ ipilẹ ede pupọ diẹ sii ati isọpọ ti o pọ pẹlu awọn aṣoju orisun LLM fun awọn oluranlọwọ ohun opin-si-opin. Reti isọdi ti o ni oro sii (igbega ọrọ, awọn ohun aṣa lati awọn iṣẹju ti data), agbara ariwo-ayika ti o dara julọ, ati imuṣiṣẹ ti o tan GPU aarin data si awọn ẹrọ eti bi Jetson. Bi NeMo ṣe ndagba lẹgbẹẹ awọn awoṣe ipilẹṣẹ, laini laarin idanimọ ọrọ, itumọ, ati ironu ibaraẹnisọrọ yoo tẹsiwaju lati blur sinu awọn opo gigun ti akoko gidi.

Real-World imuse

Ipilẹṣẹ ile-iṣẹ ipe ni akoko gidi ati oluranlowo laaye ṣe iranlọwọ pe awọn ifori awọn ipe alabara pẹlu awọn akoko akoko ipele-ọrọ

Ṣiṣe awọn ohun TTS ti aṣa ti aṣa fun oluranlọwọ foju nipasẹ ṣiṣe atunṣe-daradara FastPitch ni NeMo lori awọn wakati diẹ ti awọn gbigbasilẹ

Ifilelẹ ifiwe ati itumọ ọrọ fun apejọ fidio tabi awọn iṣẹlẹ ṣiṣanwọle lori NVIDIA GPUs

Ṣiṣatunṣe didara awoṣe ASR Conformer kan lori iṣoogun kan pato-ašẹ tabi awọn fokabulari ofin nipa lilo NeMo, lẹhinna ṣiṣẹsin nipasẹ Riva

Awọn ewu & Awọn ọna iṣọ

ilokulo ohun ati awọn ewu afarawe ṣe pọ si nigbati igbanilaaye ba sonu.

Yiye le ju silẹ kọja awọn asẹnti, awọn ede-ede, tabi awọn agbegbe alariwo.

Ohun afetigbọ sintetiki le jẹ aṣiṣe fun ọrọ ododo laisi isamisi to yege.

Ilana Ilana imuse

1

Gba ifọkansi ti o fojuhan fun gbigba ohun, ti ẹda, ati ilotunlo.

2

Didara idanwo kọja awọn agbohunsoke oniruuru ati awọn ipo abẹlẹ.

3

Ṣetumo nigbati eniyan gbọdọ ṣe atunyẹwo tabi fọwọsi awọn abajade.

4

Aami ohun sintetiki ki o tọju awọn igbasilẹ provenance fun iṣiro.

Tesiwaju Ṣiṣawari

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the NVIDIA Riva and NeMo Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bẹrẹ adanwo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Itọsọna atẹle

PESQ ati STOI Awọn Metiriki Didara Ọrọ

Awọn ibeere ti a beere nigbagbogbo

Kini NVIDIA Riva ati NeMo Ọrọ?

NVIDIA Riva jẹ SDK isare GPU fun iṣelọpọ ọrọ AI (ASR, TTS, ati itumọ), lakoko ti NeMo jẹ ohun elo irinṣẹ orisun-ìmọ fun ikẹkọ ati ṣiṣe atunṣe awọn awoṣe ti o wa labẹ. Papọ wọn jẹ ki awọn olupilẹṣẹ kọ yarayara, awọn ohun elo ohun asefara ti o ṣiṣẹ lori ohun elo NVIDIA.

Kini iyatọ akọkọ laarin NeMo ati Riva?

NeMo jẹ ohun elo irinṣẹ orisun-ìmọ fun kikọ ati isọdọtun-fifẹ ọrọ ati awọn awoṣe ede, lakoko ti awọn idii Riva ati ṣe iranṣẹ awọn awoṣe wọnyẹn fun lilo iṣelọpọ lairi kekere.

Awọn imọ-ẹrọ NVIDIA meji wo ni Riva gbarale lati ṣaṣeyọri itọkasi-kekere?

Riva ṣe akopọ awọn awoṣe pẹlu TensorRT fun ipaniyan GPU iṣapeye ati ṣe iranṣẹ fun wọn nipasẹ olupin Ifitonileti Triton, eyiti o ṣe mimu batching ti o ni agbara ati ibaramu.

Ninu opo gigun ti epo Riva TTS aṣoju, kini ipa ti vocoder bii HiFi-GAN?

Awoṣe akositiki gẹgẹbi FastPitch ṣe asọtẹlẹ awọn ẹya spectrogram lati ọrọ, ati vocoder nkankikan bi HiFi-GAN yi awọn ẹya wọnyẹn pada si fọọmu igbi igbohun ikẹhin.

Kini 'sisanwọle' ASR ni Riva ṣiṣẹ?

Ṣiṣe idanimọ ṣiṣanwọle ohun ni awọn ṣoki kekere ati gbejade awọn abajade apakan ni akoko gidi, dipo iduro fun gbogbo ọrọ lati pari.

Ewo ni apẹẹrẹ ti isọdi NeMo n fun awọn awoṣe ọrọ?

NeMo jẹ ki awọn olupilẹṣẹ ṣe atunṣe awọn awoṣe ti a ti kọkọ ni itanran lori data tiwọn, fun apẹẹrẹ mimuṣatunṣe awoṣe ASR kan lati ṣe idanimọ iṣoogun pataki tabi awọn ọrọ ofin.