Műszaki ÚTMUTATÓ

Ray az elosztott AI-hoz

A Ray egy nyílt forráskódú keretrendszer, amely megkönnyíti a Python és az AI-munkaterhelések méretezését laptopról több ezer gépből álló fürtre.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it gives a simple, unified way to distribute training, tuning, data processing, and serving without rewriting your code for each.

Mély merülés

A Ray alapötlete az, hogy a szokásos Python-függvényeket és osztályokat minimális változtatással elosztott egységekké alakítsa. A távoli „feladatként” megjelölt függvény aszinkron módon fut a fürt bármely dolgozóján; a távoli „színészként” megjelölt osztály egy dolgozón élő állapotfüggő szolgáltatássá válik. A Ray könnyű határidős ügyleteket (objektumhivatkozásokat) ad vissza, és kezeli az ütemezést, az adatmozgatást egy megosztott objektumtárolón keresztül, valamint a hibatűrést. Ezen az alapon felül találhatók a célra épített könyvtárak: Ray Train az elosztott modellképzéshez, Ray Tune a hiperparaméteres kereséshez, Ray Data az adatfolyamok streameléséhez, RLlib a megerősítő tanuláshoz és Ray Serve a méretezhető modellszolgáltatáshoz. Ez lehetővé teszi, hogy egy fürt a teljes ML-munkafolyamatot a végétől a végéig kezelje.

Technikai betekintés

A legfontosabb primitívek a feladatok (állapot nélküli, párhuzamos függvényhívások) és a szereplők (állapotot adó dolgozók, akik olyan dolgokat tárolnak, mint egy betöltött modell vagy egy számláló). Amikor meghív egy távoli feladatot, a Ray azonnal visszaad egy jövőt, és ütemezi a munkát az elérhető CPU-k/GPU-k között; meghívod a ray.get() függvényt az eredmények lekéréséhez. Az elosztott memórián belüli objektumtároló nulla másolatot tartalmazó megosztott memóriával hatékonyan mozgatja a nagy objektumokat, például a tömböket a dolgozók között, elkerülve az ismételt szerializálást, és felgyorsítja az adatigényes AI-folyamatokat.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A Ray jövője az elosztott mesterséges intelligencia számára

A Ray a nagyméretű mesterséges intelligencia gerincévé vált, különösen a nagy nyelvi modellek képzésében és kiszolgálásában. Növekedés várható az LLM-specifikus kiszolgálás terén (Ray Serve vLLM-mel), heterogén GPU-ütemezés, szorosabb integráció a KubeRay-en keresztül az adattókkal és a Kubernetes-szel, valamint jobb automatikus skálázás a tüskés generatív munkaterhelésekhez. Ahogy a modellek növekszenek, Ray szerepe a több csomópontos képzésben, az RLHF-folyamatok és a kötegelt következtetések lebonyolításában valószínűleg bővülni fog több ezer gyorsítón keresztül.

Valós megvalósítás

A Ray Tune futtatásával több száz hiperparaméter-kombinációban kereshet párhuzamosan egy GPU-fürtben, hogy megtalálja a legjobb modellkonfigurációt

A Ray Train használata a mély tanulási modell betanításának elosztására számos GPU-n és csomóponton, minimális kódmódosítással

Kötegelt következtetési folyamat építése Ray Data segítségével rekordok millióinak eléréséhez egy modellen keresztül egy klaszteren keresztül

Több modell telepítése egyetlen automatikus skálázási végpont mögé a Ray Serve segítségével a változó éles forgalom kezelésére

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Ray for Distributed AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Ray for Distributed AI?

A Ray egy nyílt forráskódú keretrendszer, amely megkönnyíti a Python és az AI-munkaterhelések méretezését laptopról több ezer gépből álló fürtre. Ez azért fontos, mert egyszerű, egységes módot ad a betanítás, a hangolás, az adatfeldolgozás és a kiszolgálás elosztására anélkül, hogy mindegyik kódját át kellene írni.

Melyik problémát oldja meg elsősorban Ray?

A Ray egységes, egyszerű módszert biztosít a számítások sok gépen való elosztására anélkül, hogy átírná a kódot az egyes terheléstípusokhoz.

Ray-ben mi a különbség a „feladat” és a „színész” között?

A feladatok állapot nélküli, párhuzamosan futó távoli függvények, míg a szereplők hosszú életű objektumok, amelyek állapotot tartanak, mint egy betöltött modell.

Mit ad vissza Ray azonnal, amikor elindít egy távoli feladatot?

Ray azonnal visszaad egy könnyű jövőt, így a munka aszinkron módon zajlik; meghívja a ray.get() függvényt, hogy szükség esetén lekérje a tényleges eredményt.

Melyik Ray-könyvtár készült elosztott hiperparaméteres keresésre?

A Ray Tune számos hiperparaméter-próba futtatására specializálódott egy fürtön keresztül.

Hogyan teszi a Ray objektumtárolója hatékonysá az adatigényes AI-folyamatokat?

A megosztott memórián belüli objektumtároló nulla másolati olvasást használ, így a dolgozók költséges újraszerializálás nélkül érhetik el a nagy tömböket.