Imọ Itọsọna

Triton Inference Server

Triton Inference Server jẹ ipilẹ orisun orisun NVIDIA fun gbigbe ati ṣiṣe awọn awoṣe AI ni iṣelọpọ ni iwọn.

2 min kakẹhin imudojuiwọn

Akopọ

O ṣe pataki nitori pe o ṣe deede iye awọn awoṣe — kọja awọn ilana oriṣiriṣi — ti gbalejo, batched, ati wọle si lẹhin API ti o munadoko kan.

Jin Dive

Triton joko laarin awọn awoṣe ikẹkọ rẹ ati awọn ohun elo ti o pe wọn. O kojọpọ awọn awoṣe lati 'ibi ipamọ awoṣe' ati ṣe iranṣẹ fun wọn lori HTTP/REST ati gRPC. Ẹya iduro rẹ jẹ ilana-agnostic: apẹẹrẹ Triton kan le ṣe iranṣẹ ni nigbakannaa PyTorch, TensorFlow, ONNX, TensorRT, ati paapaa Python tabi awọn ẹhin aṣa. Awọn agbara bọtini pẹlu batching ti o ni agbara, eyiti o ṣe akojọpọ awọn ibeere ti nwọle ti nwọle ti o sunmọ ni akoko lati lo GPU daradara siwaju sii; ipaniyan awoṣe nigbakanna, ṣiṣe awọn awoṣe pupọ tabi awọn adakọ pupọ lori GPU kan; ati awọn akojọpọ awoṣe / iwe afọwọkọ-ọrọ-ọrọ, eyiti iṣaju iṣaju pq, itọkasi, ati ṣiṣe ifiweranṣẹ sinu opo gigun ti ẹgbẹ olupin kan. O ṣafihan awọn metiriki Prometheus, ṣe atilẹyin ẹya awoṣe, ati awọn iwọn daradara ni Kubernetes.

Imọ-imọ-ẹrọ

Yiyi batching ni mojuto losi lefa. Awọn GPUs jẹ ṣiṣe daradara julọ awọn ipele nla, ṣugbọn awọn ibeere iṣelọpọ de ọkan ni akoko kan. Triton ṣe awọn ibeere fun window atunto kekere kan (fun apẹẹrẹ, awọn milliseconds diẹ), dapọ wọn sinu ipele kan, ṣiṣe ipinnu kan, lẹhinna pin awọn abajade pada si olupe kọọkan. Eyi bosipo mu lilo GPU pọ si pẹlu idiyele lairi kekere nikan. Ipaniyan nigbakanna ati fun apẹẹrẹ awọn ẹgbẹ apẹẹrẹ jẹ ki GPU kan duro nšišẹ kọja ọpọlọpọ awọn awoṣe ni ẹẹkan.

Ipa Ilana

Iye owo ati isuna

Awọn ipinnu faaji ṣe awakọ iṣẹ ati idiyele iṣẹ fun awọn ọdun.

Awọn ipinnu diẹ sii

Ẹkọ imọ-ẹrọ ṣe iranlọwọ fun awọn ẹgbẹ lati yan akopọ to tọ, kii ṣe ọkan tuntun nikan.

Iṣakoso didara

Awọn yiyan imọ-ẹrọ to dara julọ dinku awọn iṣẹlẹ igbẹkẹle ni iṣelọpọ.

Ojo iwaju ti Triton Inference Server

Triton n dagbasoke si awoṣe nla ati awọn iṣẹ ṣiṣe ti ipilẹṣẹ, ni iṣọpọ ni wiwọ pẹlu TensorRT-LLM ati awọn ẹhin ara-vLLM fun ṣiṣanwọle ami-giga. Reti atilẹyin ti o jinle fun iṣẹ isinpin, GPU-pupọ ati isọdọkan tensor-node pupọ, ipa ọna KV-cache-aware, ati idiwon OpenAI-awọn aaye ipari ibaramu. Bi awọn ajo ṣe nṣiṣẹ awọn dosinni ti awọn awoṣe, ipa Triton bi irẹpọ kan, Layer sìn ti o ṣe akiyesi ni Kubernetes ati akopọ NVIDIA Dynamo yoo dagba.

Real-World imuse

Alejo awoṣe wiwa jegudujera, awoṣe iṣeduro kan, ati ikasi aworan kan lori olupin GPU ti o pin ni lilo ipaniyan awoṣe asiko

Lilo batching ti o ni agbara lati ṣe iranṣẹ API idanimọ aworan-ọja-giga nitoribẹẹ awọn ibeere ti o tuka ti wa ni akojọpọ fun itọkasi GPU daradara

Ṣiṣe akojọpọ ẹgbẹ olupin kan ti o nṣiṣẹ iṣaju aworan, aṣawari TensorRT kan, ati aami lẹhin ilana ni opo gigun ti Triton kan ṣoṣo

Gbigbe LLM kan pẹlu ẹhin TensorRT-LLM ni Triton lati san awọn idahun chatbot si ẹgbẹẹgbẹrun awọn olumulo nigbakan

Awọn ewu & Awọn ọna iṣọ

Ṣiṣepe ala-ilẹ kan le tọju awọn ailagbara eto ti o gbooro.

Awọn ohun elo amayederun ati awọn idiyele itọju nigbagbogbo ni aibikita.

Aabo ati awọn ela akiyesi le dagba bi awọn eto ṣe di eka sii.

Ilana Ilana imuse

1

Ṣetumo lairi, didara, ati awọn ibi-afẹde idiyele ṣaaju imuse.

2

Aṣepari labẹ ẹru ojulowo ati awọn ipo data.

3

Abojuto ohun elo fun awọn aṣiṣe, fiseete, ati ipa olumulo.

4

Mura ipadasẹhin pada ati awọn ipa ọna esi iṣẹlẹ ṣaaju iwọn.

Tesiwaju Ṣiṣawari

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Triton Inference Server quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bẹrẹ adanwo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Itọsọna atẹle

AI Inference Iṣapeye

Awọn ibeere ti a beere nigbagbogbo

Kini Triton Inference Server?

Triton Inference Server jẹ ipilẹ orisun orisun NVIDIA fun gbigbe ati ṣiṣe awọn awoṣe AI ni iṣelọpọ ni iwọn. O ṣe pataki nitori pe o ṣe idiwọn iye awọn awoṣe - kọja awọn ilana oriṣiriṣi - ti gbalejo, ti ṣeto, ati wọle lẹhin API daradara kan.

Kini o jẹ ki Triton Inference Server 'fireemu-agnostic'?

Triton ṣe atilẹyin awọn ẹhin ọpọ nigbakanna, nitorinaa awọn awoṣe ti oṣiṣẹ ni awọn ilana oriṣiriṣi le ṣe iranṣẹ lati olupin kanna.

Bawo ni batching ìmúdàgba ṣe ilọsiwaju iṣẹ?

Batching ti o ni agbara duro de ferese kekere kan lati dapọ awọn ibeere sinu ipele kan, igbega iṣamulo GPU nitori awọn GPU jẹ daradara julọ lori awọn ipele nla.

Kini iṣowo-pipa ti a ṣe nipasẹ batching ti o ni agbara?

Idaduro awọn ibeere ni ṣoki lati ṣe ipele kan ṣe afikun lairi diẹ ṣugbọn pupọ pọ si iye awọn ibeere ti GPU le mu.

Kini akojọpọ awoṣe Triton kan (tabi iwe afọwọkọ-ọrọ-ọrọ) jẹ ki o ṣe?

Awọn akojọpọ so awọn igbesẹ pupọ pọ nitoribẹẹ ibeere ẹyọkan nfa opo gigun ti epo ni kikun lori olupin, yago fun awọn irin-ajo iyipo afikun si alabara.

Kini 'ipaniyan awoṣe nigbakan' ni Triton?

Triton le jẹ ki GPU n ṣiṣẹ lọwọ nipa ṣiṣe ọpọlọpọ awọn awoṣe tabi awọn iṣẹlẹ nigbakanna, imudarasi iṣamulo ohun elo.