Haberlere Geri Dön
YenilikAI Understanding brifing

Denetim, verimli LLM çıkarımı için SWIFT'in ConfLayers'tan daha doğru ve daha hızlı olduğunu tespit ediyor

Üç tohumlu bir denetim, SWIFT'in genellikle doğruluk açısından güven kapılı katman atlamadan daha iyi performans gösterdiğini ve arama yükü ayrıldıktan sonra daha yüksek saf çıkarım hızına ulaştığını bildiriyor. The study also found modest gains but substantial accuracy losses for two trained-routing methods.

5 min readRead the primary source
Source-provided image accompanying Audit finds SWIFT more accurate and faster than ConfLayers for efficient LLM inference
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.28846
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Büyük Dil Modeli (LLM)
Metin oluşturmak ve analiz etmek için çok büyük metin toplulukları üzerinde eğitilmiş bir dil modeli.
Çıkarım
Eğitilmiş bir modelin tahminler veya çıktılar ürettiği çalışma zamanı aşaması.
Evrişimli Sinir Ağı (CNN)
Görüntüler gibi ızgara benzeri verileri işlemek için optimize edilmiş bir sinir mimarisi.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Yeni bir arXiv ön baskısı, büyük dil modeli çıkarımı sırasında bazı dönüştürücü katmanları atlayan yöntemleri değerlendirir. Yazarlar, vanilya otoregresif kod çözmeyi, GSM8K akıl yürütme ve CNN/DailyMail özetleme görevlerinde Qwen2.5-0.5B ve Qwen2.5-1.5B genelinde güven kapılı bir erken çıkış yöntemi olan ConfLayers ve kendi kendine spekülatif bir kod çözme yöntemi olan SWIFT ile karşılaştırır.

Ön baskı, periyodik adımlı katman atlama yöntemlerinin titizlikle eşleştirilmiş, üç tohumlu denetimi olarak adlandırdığı şeyi sunuyor. Bu sistemler bir giriş için hangi transformatör katmanlarının yürütüleceğine karar verir ve bu kararı her birkaç nesil adımda yeniden gözden geçirir. Karşılaştırma vanilya otoregresif kod çözmeyi, ConfLayers'ı ve SWIFT'i içerir. ConfLayers, güven kapılı bir erken çıkış temeli olarak tanımlanırken, SWIFT, gerçek kendi kendine spekülatif kod çözme olarak tanımlanıyor. Yazarlar her iki yöntemi de iki Qwen2.5 model ölçeğinde, 0,5 milyar ve 1,5 milyar parametrede ve iki görev üzerinde değerlendiriyor: GSM8K muhakemesi ve CNN/DailyMail özetlemesi.

Makale, SWIFT'in dört model ve görev kombinasyonunun üçünde doğruluk açısından en güçlü yöntem olduğunu bildiriyor. ConfLayers'ın her hücrede hakim olduğu ve özellikle GSM8K'de 1.5B ölçeğinde büyük açıkların olduğu bildirildi. Kaynak, sağlanan metinde doğruluk değerlerinin tam tablosunu sağlamadığından, tam kenar boşlukları burada bağımsız olarak belirtilemez. Bu nedenle temel sonuç, her iki yöntemin de tüm dil modellerinde veya iş yüklerinde evrensel olarak üstün olduğu iddiasından ziyade yazarların karşılaştırmalı sıralamasıdır.

Denetimin önemli bir kısmı, çevrimiçi arama yükünü, modelin kendisini çalıştırma maliyetinden ayırır. Bu ölçümde yazarlar, SWIFT'in saf çıkarım hızının dört hücrenin tamamında ConfLayers'ınkinden %5 ila %21 daha yüksek olduğunu ve üç durumda saf duvar saati sıralamasını tersine çevirdiğini bildirdi. ConfLayers'ın arama yükünün küçük ve istikrarlı olduğu, maliyetin %1 ila %2 arasında olduğu bildirilirken, SWIFT'inki daha büyük ve daha değişken olup %28,7'ye kadar yükseldi. Makale ayrıca, daha kaba ayrıntı düzeyinde kararlar veren iki eğitimli yönlendirme yöntemi olan LayerRoute ve LayerDrop'un tamamlayıcı bir analizini de içermektedir. Yazarların doğrulanmış protokol olarak adlandırdığı protokol altında, her ikisi de 1,08x ile 1,33x arasında mütevazı bir hızlanma üretti ancak bunların doğruluğu, periyodik adımlı yöntemlerin doğruluğunun altındaydı. LayerRoute'un GSM8K'de 1,5B'de bildirdiği ortalama tam eşleşme, üç tohumda 0,003 idi.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Makale, çevrimiçi arama maliyetleri ve gerçek çıkarım maliyetleri birbirinden ayrılmadan birleştirildiğinde verimlilik karşılaştırmalarının yanıltıcı olabileceğini savunuyor. Sonuçlar, duvar saati ölçümlerinde daha hızlı görünen bir yöntemin, hangi katmanların atlanacağına karar verme maliyeti hesaba katıldığında daha az verimli olabileceğini gösteriyor.

Pratik sorun, çıkarım verimliliğinin birden fazla bileşene sahip olmasıdır. Katman atlama yöntemi, neyin çalıştırılacağını seçen ayrı bir karar süreci eklerken sinir ağı hesaplama miktarını azaltabilir. Değerlendirmeler yalnızca uçtan uca duvar saati süresini veya yalnızca yürütülen model katmanlarının maliyetini rapor ediyorsa, farklı sıralamalar üretebilir. Makalenin karşılaştırması bu ölçüm sorununu vurguluyor ve verimlilik iddialarını daha doğrudan karşılaştırılabilir hale getirmeyi amaçlayan bir protokol sağlıyor.

Dil modellerine hizmet veren operatörler için rapor edilen sonuçlar, yürütülen katmanların azaltılmasının tek başına yeterli olmadığını göstermektedir. Doğruluk, karar verme yükü ve yönlendirmenin gerçekleştiği ayrıntı düzeyi çok önemlidir. Mütevazı bir hesaplama kısayoluna sahip bir yöntem, akıl yürütme görevlerinde kalitesi keskin bir şekilde düşerse çekici olmayabilir. Tersine, daha yüksek arama maliyetine sahip bir yöntem, test edilen kurulum altında daha fazla doğruluğu korursa ve daha iyi saf çıkarım hızı sağlarsa yine de tercih edilebilir. Bunlar rapor edilen deneylerin sonuçlarıdır; herhangi bir yöntemin üretim maliyetlerini azaltacağının kanıtı değildir.

Çalışma aynı zamanda eğitimli yönlendirme sistemlerini, değerlendirme protokolü eşleşmeden çevrimiçi, periyodik adımlı yöntemlerle karşılaştırmanın risklerini de göstermektedir. Yazarlar, tamamlayıcı analiz için gerçek bir tam model temel çizgisi, gerçek girdi başına geçiş ve gerçek çıkarım zamanı hesaplama atlama kullandıklarını söylüyorlar. Bu kontroller önemlidir çünkü nominal olarak seyrek veya yönlendirilmiş bir model, uygulama hala atlanan işin çoğunu gerçekleştiriyorsa gerçek hesaplamayı kaydetmede başarısız olabilir. Makalenin bir GSM8K ayarında LayerRoute için neredeyse çökmeye yakın rapor etmesi, hız kazanımlarının göreve özgü kalite açısından ciddi ödünleşimlerle gelebileceğini gösteriyor.

Kaynak, tam denetim protokolünü titizlikle eşleşen verimlilik karşılaştırmaları için bir şablon olarak yayınlayarak faydalı bir metodolojik katkı sağlıyor. Bu, araştırmacıların ve mühendislik ekiplerinin arama yükünü, çıkarım maliyetini, doğruluğunu, model ölçeğini ve görev koşullarını daha tutarlı bir şekilde raporlamasına yardımcı olabilir. Yine de kaynak, protokolün diğer araştırmacılar tarafından benimsendiğini ortaya koymuyor ve ticari modeller, özel çıkarım donanımları, daha uzun bağlamlar, etkileşimli iş yükleri veya gerçek kullanıcılar hakkındaki sonuçları göstermiyor.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Bulguların daha fazla model boyutu, mimari, görev, donanım ayarı ve uygulama ortamında test edilmesi gerekiyor. Makale birinci versiyonun ön baskısıdır ve sonuçları, bağımsız çoğaltma veya üretim dağıtımının kanıtlarından ziyade yazarların rapor ettiği protokole dayanmaktadır.

Bir sonraki en önemli adım, iki Qwen2.5 model boyutunun ve değerlendirilen iki görevin ötesinde çoğaltmadır. GSM8K ve CNN/DailyMail akıl yürütmeyi ve özetlemeyi temsil eder, ancak çıkarım verimliliğinin önemli olduğu iş yüklerinin tamamını kapsamazlar. Sonuçlar kodlama, çok dilli oluşturma, uzun bağlam erişimi, araç kullanımı, yapılandırılmış çıktı veya çok modlu modeller için farklılık gösterebilir. Kaynak bu tür testleri bildirmiyor.

Donanım ve yazılım uygulaması da önemli olacaktır. Sağlanan kaynak, göreceli genel giderleri ve hızlanmaları bildirir ancak deneylerde kullanılan donanımı, çalışma zamanı yapılandırmasını, toplu iş boyutlarını, belirteç oluşturma ayarlarını veya dağıtım koşullarını tanımlamaz. Bu ayrıntılar, ölçülen ödünleşimlerin veri merkezi hizmetine, yerel çıkarıma veya diğer ortamlara aktarılıp aktarılmadığını belirlemek için gereklidir. Kaynak tarafından hiçbir üretim maliyeti, enerji, gecikme-hizmet düzeyi veya kullanılabilirlik sonucu belirlenmez.

Makale aynı zamanda yerleşik bir fikir birliği olarak değil, bir ön baskı sonucu olarak okunmalıdır. 28 Ağustos 2026'da birinci sürüm olarak arXiv'ye gönderildi ve kaynakta herhangi bir hakem değerlendirmesi sonucu veya bağımsız doğrulama belirtilmedi. Yazarların ConfLayers, SWIFT, LayerRoute ve LayerDrop hakkındaki iddiaları seçtikleri uygulamalara ve protokollere bağlıdır. Kaynak, daha sonraki sürümlerin, alternatif ayar seçeneklerinin veya farklı yönlendirme eşiklerinin sıralamayı değiştirip değiştirmeyeceğini söylemiyor.

Daha ileri çalışmalar, gerçekçi iş yükleri altında arama ek yükü ile toplam sistem maliyeti arasındaki ilişkiyi açıklığa kavuşturmalıdır. SWIFT'in ek yükünün değişken olduğu ve %28,7 kadar yüksek olduğu bildirildi; saf çıkarım hızı ise test edilen hücrelerde ConfLayers'ınkinden daha yüksekti. Bu dengelemenin olumlu olup olmadığı iş yükünün şekline, gecikme hedeflerine, donanım kullanımına ve doğruluğa verilen değere bağlıdır. Okuyucular, daha büyük denetimleri, yayınlanan kodu veya kıyaslama yapılarını, bağımsız kopyaları ve hem uçtan uca gecikmeyi hem de ayrıştırılmış hesaplama maliyetlerini raporlayan değerlendirmeleri izlemelidir.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıTransformatörlerYapay Zeka EğitimiYapay Zekanın GeleceğiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?