Imọ Itọsọna

TensorRT ati Inference Engines

TensorRT jẹ ile-ikawe NVIDIA ti o ṣe akopọ awọn nẹtiwọọki alakikan ti ikẹkọ sinu awọn ẹrọ iṣapeye giga ti o yara yiyara lori awọn NVIDIA GPUs.

2 min kakẹhin imudojuiwọn

Akopọ

O ṣe pataki nitori awoṣe kanna le ṣiṣe 2-6x yiyara ati din owo ni akoko inference laisi iyipada ohun ti o ṣe asọtẹlẹ.

Jin Dive

Ẹnjini itọkasi gba awoṣe oṣiṣẹ kan ati atunkọ rẹ fun ipaniyan iyara ti o ṣeeṣe lori ohun elo ibi-afẹde. TensorRT ṣe eyi fun NVIDIA GPUs nipasẹ awọn igbesẹ pupọ. O ṣe idapọpọ Layer, awọn iṣẹ iṣọpọ bii convolution, aibikita-fikun, ati ReLU sinu ekuro GPU kan lati ge ijabọ iranti. O kan isọdiwọn konge, sisọ silẹ lati FP32 si FP16 tabi INT8 (ati FP8 lori Hopper) lakoko ti o tọju deede. O n ṣe atunṣe-aifọwọyi ekuro, ti o ṣe afihan ọpọlọpọ awọn imuse ti Layer kọọkan lori GPU gangan rẹ ati yiyan iyara julọ. Abajade jẹ faili 'engine' serialized ti a ṣe aifwy si faaji GPU kan. TensorRT-LLM faagun eyi pẹlu oju-iwe KV-cache, batching ninu ọkọ ofurufu, ati isọdọkan tensor fun awọn awoṣe ede nla.

Imọ-imọ-ẹrọ

Awọn iyara ti o tobi julọ wa lati awọn ẹtan meji. Iṣọkan Kernel yọkuro awọn irin-ajo iyipo lati fa fifalẹ iranti GPU agbaye nipasẹ titọju awọn abajade agbedemeji ni awọn iforukọsilẹ iyara ati iranti pinpin. Quantization to INT8 ṣe akopọ awọn iye mẹrin nibiti FP32 kan joko, ipasẹ iṣiro quadrupling lori awọn ohun kohun tensor, ṣugbọn o nilo data isọdiwọn lati ṣe iṣiro awọn ifosiwewe igbelowọn fun-tensor ki sakani nọmba ti o dinku ko ba jẹ deede. Ẹnjini naa jẹ ohun elo-pato nitori pe atunwi adaṣe n ṣe ni awọn kernel ti o dara julọ fun ipilẹ GPU gangan ati ipilẹ iranti.

Ipa Ilana

Iye owo ati isuna

Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.

Awọn ipinnu diẹ sii

Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.

Iṣakoso didara

Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.

Ojo iwaju ti TensorRT ati Awọn ẹrọ Inference

Awọn ẹrọ itọka n gbe si ọna konge kekere (FP8, FP4, ati awọn ero idapọ) ati awọn ẹya ara LLM-pato gẹgẹbi iyipada arosọ ati ijafafa KV-cache paging. TensorRT-LLM ati awọn oludije bii vLLM n pejọ lori iṣaju iṣaju ti a ti pin / ipinnu ati batching lemọlemọfún. Reti isọpọ alakojọ tighter (Torch-TensorRT, ONNX), pipọ adaṣe adaṣe pẹlu isọdi afọwọṣe ti o dinku, ati atilẹyin gbooro fun ipa-ọna awọn alamọja bi ṣiṣe awọn awoṣe nla ni olowo poku di ogun idiyele aarin.

Real-World imuse

Yiyipada awoṣe wiwa ohun-elo YOLO kan si ẹrọ TensorRT INT8 nitorinaa o ṣiṣẹ ni akoko gidi lori NVIDIA Jetson ninu robot tabi kamẹra ọlọgbọn.

Ṣiṣe iranṣẹ Llama kan tabi awoṣe Mistral pẹlu TensorRT-LLM ni lilo batching inu-ọkọ ofurufu lati mu awọn ami-ami ga-fun-keji lori awọn GPU H100 ni ẹhin iwiregbebot kan

Iṣapejuwe awoṣe idanimọ-sisọ pẹlu pipe FP16 lati ge airi iwe afọwọkọ ni iṣẹ ifọrọranṣẹ laaye

Iṣakojọpọ nẹtiwọọki ipo iṣeduro si ẹrọ TensorRT ti o dapọ lati mu awọn miliọnu awọn ibeere fun iṣẹju kan ni idiyele GPU kekere

Awọn ewu & Awọn ọna iṣọ

Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.

Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.

Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.

Ilana Ilana imuse

1

Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.

2

Aṣepari labẹ ẹru ojulowo ati awọn ipo data.

3

Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.

4

Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.

Tesiwaju Ṣiṣawari

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the TensorRT and Inference Engines quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bẹrẹ adanwo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Itọsọna atẹle

AI Inference Iṣapeye

Awọn ibeere ti a beere nigbagbogbo

Kini TensorRT ati Inference Engines?

TensorRT jẹ ile-ikawe NVIDIA ti o ṣe akopọ awọn nẹtiwọọki alakikan ti ikẹkọ sinu awọn ẹrọ iṣapeye giga ti o yara yiyara lori awọn NVIDIA GPUs. O ṣe pataki nitori awoṣe kanna le ṣiṣe ni iyara 2-6x ati din owo ni akoko itọkasi laisi iyipada ohun ti o sọtẹlẹ.

Kini idi akọkọ ti ẹrọ itọkasi bi TensorRT?

Awọn ẹrọ inference gba awoṣe ti a ti kọ tẹlẹ ki o tun kọwe fun iyara ti o pọju lori ohun elo kan pato; won ko ba ko irin si dede.

Bawo ni idapọ Layer ṣe iyara itọkasi?

Fusion darapọ awọn iṣẹ bii conv, ojuṣaaju, ati imuṣiṣẹ sinu ekuro kan nitorina awọn abajade agbedemeji duro ni iranti iyara dipo kikọ kikọ pada lati fa fifalẹ iranti agbaye.

Kini idi ti titobi INT8 ni igbagbogbo nilo data isọdọtun kan?

Isọdiwọn nṣiṣẹ data aṣoju nipasẹ awoṣe lati pinnu awọn ifosiwewe iwọn-tensor, nitorinaa iwọn INT8 to lopin ṣe itọju awọn ipinpinpin iye pataki.

Kini idi ti ẹrọ TensorRT ti o ṣajọ ni gbogbogbo ni pato si faaji GPU kan?

Awọn kernels atunwi aifọwọyi lori GPU ibi-afẹde ati yan awọn ti o dara julọ, ṣiṣe ẹrọ ti so mọ awọn abuda faaji yẹn.

Ẹya wo ni TensorRT-LLM ṣe iranlọwọ ni pataki lati sin awọn awoṣe ede nla ni daradara?

TensorRT-LLM ṣe afikun awọn iṣapeye-pato LLM bii batching ninu ọkọ ofurufu ati oju-iwe KV-cache lati mu igbejade pọ si lori awọn ẹru iṣẹ iran-ọrọ.