PRZEWODNIK techniczny

Wykresy rdzenia i wnioskowania Seldona

Seldon Core to platforma typu open source do wdrażania modeli uczenia maszynowego w Kubernetes, z wyróżniającą funkcją: wykresami wnioskowania.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

Instead of serving one isolated model, it lets you chain models, routers, combiners, and transformers into a single directed graph that runs as one deployable service.

Głębokie nurkowanie

Wiele rzeczywistych przypadków użycia w środowisku produkcyjnym obejmuje więcej niż jedno wywołanie modelu. Możesz wstępnie przetworzyć dane wejściowe, skierować żądanie do jednego z kilku modeli, uruchomić zestaw, a następnie poddać wynik obróbce końcowej. Seldon Core wyraża to jako wykres wnioskowania zdefiniowany w SeldonDeployment (lub, w architekturze v2, za pośrednictwem Seldon Core Operator i MLServer). Wykres jest zbudowany z typów komponentów wielokrotnego użytku: Model obsługuje prognozy, Transformator modyfikuje wejścia lub wyjścia, Router decyduje, które dziecko wywołać (umożliwiając testy A/B i wielorękich bandytów), a Combiner agreguje dane wyjściowe z wielu modeli w celu złożenia. Seldon obsługuje wiele frameworków za pośrednictwem gotowych serwerów i niestandardowych opakowań Pythona, a także udostępnia bogate metryki, rozproszone śledzenie i natychmiastowe rejestrowanie ładunku w celu zapewnienia obserwowalności i wyjaśnienia.

Wgląd techniczny

Wykres wnioskowania to skierowany graf acykliczny, w którym każdy węzeł jest mikrousługą ze standardowym interfejsem przewidywania, a orkiestrator Seldona (organizator/wykonawca usługi) kieruje żądanie przez wykres i łączy odpowiedzi. Ponieważ routery mogą implementować logikę wielorękiego bandyty, ruch może adaptacyjnie przesuwać się w stronę lepiej działających modeli w oparciu o aktualne sygnały nagrody. Seldon Core v2 oddziela wykres od serwerów poszczególnych modeli przy użyciu MLServer i protokołu Open Inference Protocol, umożliwiając obsługę wielu modeli i overcommit na współdzielonym sprzęcie.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość wykresów rdzeniowych i wnioskowania Seldona

Seldon zmierza w kierunku modułowych, skoncentrowanych na danych MLOps z potokiem i konstrukcją przepływu danych w Core v2, a także ściślejszym powiązaniem z wykrywaniem dryfu (Alibi Detect) i wyjaśnialnością (Alibi Wyjaśnij). Ponieważ LLM i systemy agentowe stają się złożonymi wykresami wyszukiwania, modeli i narzędzi, abstrakcja wykresów wnioskowania w naturalny sposób odwzorowuje się na te przepływy pracy. Spodziewaj się większego nacisku na wydajność obsługi wielu modeli, przesyłanie strumieniowe i ustandaryzowaną obserwowalność, dzięki czemu złożone, wieloetapowe systemy AI będą mogły być debugowane i zarządzane w środowisku produkcyjnym.

Implementacja w świecie rzeczywistym

Pożyczkodawca łączy Transformator, który jednorazowo koduje funkcje, w węźle modelu, a następnie Transformator, który formatuje wynik, a wszystko to w ramach jednego wdrożenia Seldon.

Firma medialna wykorzystuje węzeł routera z wielorękim bandytą do dynamicznego wysyłania większego ruchu do dowolnego modelu rekomendacji, który zapewnia wyższą nagrodę za kliknięcie.

Zespół łączy trzy modele oszustw z węzłem Combiner, który uśrednia ich wyniki przed zwróceniem pojedynczej decyzji osobie dzwoniącej.

Regulowany ubezpieczyciel dołącza rejestrację ładunku Seldona i wyjaśnienia Alibi do wykresu wniosków, dzięki czemu każdą prognozę można prześledzić i wyjaśnić na potrzeby audytów.

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Seldon Core and Inference Graphs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

TensorRT i silniki wnioskowania

Często zadawane pytania

What is Seldon Core and Inference Graphs?

Seldon Core to platforma typu open source do wdrażania modeli uczenia maszynowego w Kubernetes, z wyróżniającą funkcją: wykresami wnioskowania. Zamiast obsługiwać jeden izolowany model, umożliwia łączenie modeli, routerów, sumatorów i transformatorów w jeden ukierunkowany wykres, który działa jako jedna możliwa do wdrożenia usługa.

Jaka jest cecha wyróżniająca Seldon Core od serwera jednomodelowego?

Seldon Core umożliwia łączenie modeli, routerów, sumatorów i transformatorów w jeden wykres wnioskowania wdrażany jako jedna usługa.

Który komponent grafu Seldona decyduje, do którego węzła podrzędnego wysłać żądanie, umożliwiając testy A/B?

Router kieruje żądania do jednego ze swoich dzieci i może wdrożyć testy A/B lub wielorękiego bandytę.

Który typ komponentu agreguje dane wyjściowe z wielu modeli w celu złożenia?

Łącznik łączy odpowiedzi wielu modeli podrzędnych w jeden wynik, w ten sposób budowane są zespoły.

Jaką strukturę wykresu tworzy wykres wnioskowania Seldona?

Wykresy wnioskowania Seldona to skierowane grafy acykliczne, w których każdy węzeł jest mikrousługą ze standardowym interfejsem przewidywania.

Który serwer i protokół w Seldon Core v2 umożliwiają obsługę wielu modeli na grafie?

Core v2 oddziela wykres od serwerów modelowych przy użyciu MLServer i protokołu Open Inference Protocol do obsługi wielu modeli.