Temel Bilgiler KILAVUZU

Çok Aracılı Takviye Öğrenimi

Çok Aracılı Takviyeli Öğrenme (MARL), bir ortamı paylaşan, her biri kendi davranışını uyarlarken diğerleri de uyum sağlayan çeşitli öğrenme aracılarını eğitir.

2 min readSon güncelleme

Genel Bakış

It matters because most real-world problems — traffic, markets, teams of robots — involve many decision-makers, not one.

Derin Dalış

Tek aracılı takviyeli öğrenmede, bir aracı sabit bir ortamda ödülü en üst düzeye çıkararak bir politikayı öğrenir. MARL daha fazla aracı ekler ve bu her şeyi değiştirir: Her aracının bakış açısından ortam durağan değildir çünkü diğerleri politikalarını değiştirmeye devam eder. Temsilciler işbirlikçi (futbol oynayan robotlar gibi bir takım ödülünü paylaşarak), rekabetçi (poker veya takip-kaçırma gibi sıfır toplamlı) veya karışık olabilir. Araştırmacılar, tek ajanlı Markov Karar Sürecini genelleştiren Markov oyunları (stokastik oyunlar) gibi formalizmleri kullanıyor. Ünlü sonuçlar arasında DeepMind'ın AlphaStar'ının StarCraft II'de Büyük Usta'ya ulaşması ve OpenAI Beş profesyonel Dota 2 takımını yenmesi yer alıyor; her ikisi de kendi kendine oyun yoluyla birbirlerine karşı eğitilmiş ajan popülasyonlarına güveniyor.

Teknik Bilgi

Temel zorluk, durağan olmamadır: Her etmen kendi politikasını güncelledikçe, diğerleri hareketli bir hedefle karşı karşıya kalır, dolayısıyla naif bağımsız öğrenmenin yakınsama konusunda başarısız olması mümkündür. Popüler bir düzeltme, MADDPG ve QMIX gibi algoritmalar tarafından kullanılan merkezi olmayan yürütme (CTDE) ile merkezi eğitimdir. Eğitim sırasında bir eleştirmen, kararlı eğimleri hesaplamak için tüm aracıların gözlemlerini ve eylemlerini görür, ancak dağıtım sırasında her aracı yalnızca kendi yerel gözlemlerini kullanarak hareket eder; koordineli öğrenmeyi pratik, bağımsız operasyonla birleştirir.

Stratejik Etki

Daha net kararlar

Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.

Maliyet ve bütçe

Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.

Ekip ve iş akışı

Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.

Çok Aracılı Takviyeli Öğrenmenin Geleceği

MARL, temsilcilerin girip çıktığı daha büyük, daha açık sistemlere ve birlikte pazarlık yapan, yetki veren ve araçları kullanan LLM tabanlı temsilcilerden oluşan ekiplere doğru ilerliyor. Ölçeklenebilir kredi tahsisi (büyük bir takımda ödülü hak eden), acil iletişim protokolleri ve rakip acenteler için güvenlik garantileri konusunda ilerleme bekleyebilirsiniz. Otonom araçlar, enerji şebekeleri ve ticaret sistemleri giderek daha fazla etkileşime girdikçe, güçlü çoklu kurum koordinasyonu (ve gizli anlaşmalardan veya istikrarsızlaştırıcı geri bildirim döngülerinden kaçınmak) merkezi bir pratik ve düzenleyici kaygı haline geliyor.

Gerçek Dünya Uygulaması

Depo robotlarından oluşan filoların, paketleri çarpışmadan veya koridorlarda kilitlenmeden yönlendirecek şekilde koordine edilmesi

Her kavşağın şehir çapındaki sıkışıklığı azaltmayı öğrenen bir aracı olduğu trafik sinyali kontrolü

Birçok temsilci arasında kendi kendine oynama yoluyla OpenAI Five (Dota 2) ve AlphaStar (StarCraft II) gibi eğitim oyunu AI

Akıllı bir elektrik şebekesinde dağıtılmış piller ve evler arasında teklifleri ve talep yanıtını yönetme

Riskler ve Korkuluklar

Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.

Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.

Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.

Uygulama Yol Haritası

1

İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.

2

Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.

3

Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.

4

Çok Aracılı Takviyeli Öğrenmenin nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Agent Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Takviyeli Öğrenme

Sık sorulan sorular

What is Multi-Agent Reinforcement Learning?

Çok Aracılı Takviyeli Öğrenme (MARL), bir ortamı paylaşan, her biri kendi davranışını uyarlarken diğerleri de uyum sağlayan çeşitli öğrenme aracılarını eğitir. Bu önemli çünkü gerçek dünyadaki sorunların çoğu (trafik, pazarlar, robot ekipleri) bir değil birçok karar vericiyi içeriyor.

MARL'de bir aracının bakış açısına göre ortamı 'sabit olmayan' yapan şey nedir?

Her aracı eğitim sırasında politikasını güncellediğinden, her aracı etkili bir şekilde hareketli bir hedefle karşı karşıya kalır; diğerleri öğrendikçe ortamın dinamikleri değişir.

'Merkezi olmayan yürütme ile merkezi eğitim' (CTDE) ne anlama geliyor?

MADDPG ve QMIX gibi CTDE yöntemleri, istikrarlı öğrenme için küresel bilgilerden yararlanırken, her aracı yalnızca kendi gözlemlerini kullanarak yürütür.

Hangi matematiksel çerçeve tek aracılı MDP'yi birden fazla aracıya genelleştirir?

Markov oyunları (stokastik oyunlar da denir), birden fazla karar verici arasında ortak eylemler ve temsilci başına ödüller sağlayarak MDP'leri genişletir.

Tamamen işbirliğine dayalı bir MARL ortamında ödül tipik olarak nasıl yapılandırılır?

İşbirlikçi ortamlar temsilcilere ortak bir hedef verir, bu nedenle zorluk, eylemleri koordine etmek ve ekip içinde krediyi tahsis etmek haline gelir.

Hangi teknik, OpenAI Five ve AlphaStar gibi sistemlerin insan oyun verileri olmadan gelişmesine olanak sağlar?

Kendi kendine oynama, ajanları kendilerinin gelişen versiyonlarıyla karşı karşıya getirerek giderek daha güçlü rakiplerden oluşan otomatik bir müfredat oluşturur.