Haberlere Geri Dön
YenilikAI Understanding brifing

Araştırmacılar, Transformer ileri beslemeli katmanlar için belirteç uyarlamalı aktivasyon karışımını öneriyor

Gözden geçirilmiş bir arXiv ön baskısı, dil modellerinin her bir belirteç için etkinleştirme işlevleri arasında seçim yapmasına olanak tanıyan bir ileri besleme katmanı tasarımı olan Etkinleştirme Karışımı'nı önerir. Yazarlar, 0,12B'den 2B'ye kadar parametrelere sahip modellerde terminal eğitim kaybının daha düşük olduğunu bildiriyor ancak kaynak kaydında kesin sonuçlar vermiyor.

5 min readRead the primary source
Source-page capture accompanying Researchers propose token-adaptive activation mixing for Transformer feedforward layers
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2605.26647
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Trafo
Paralel olarak diziler arasındaki ilişkileri modellemek için dikkati kullanan bir sinir mimarisi.
Jeton
Bir sözcük parçası veya sembol gibi dil modelleri tarafından işlenen bir metin yığını.
Bellek (Ajan Belleği)
Bir AI aracısının sürekliliği artırmak için adımlar veya oturumlar boyunca kullandığı kayıtlı bağlam.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

28 Ağustos'ta arXiv üzerinde revize edilen bir makale, tabanlı dil modelleri için Etkinleştirme Karması veya MoA'yı önermektedir. Tasarım, aynı doğrusal projeksiyonları paylaşırken bireysel tokenlar için çeşitli aktivasyon fonksiyonlarını karıştırmak üzere hafif, girişe bağımlı kapılar kullanır. Yazarlar ayrıca belirteç bağımlı kapılar olmadan işlevleri birleştiren öğrenilebilir aktivasyonları da tanıtıyorlar.

Yetkili kaynak, "Daha Fazla İfade Edici İleri Beslemeli Katmanlar: Bölüm I. Aktivasyonların Uyarlamalı Karıştırılması" için bir arXiv kaydıdır. Makalenin ilk olarak 26 Mayıs 2026'da sunulduğu ve 28 Ağustos'ta revize edilerek önemli güncellemenin mevcut haber penceresine yerleştirildiği belirtiliyor. Yazarlar Mingze Wang, Jinbo Wang, Yikuan Xia, Kai Shen ve Shu Zhong'dur. Kaynak, çalışmayı, dil modellerinin doğrudan konusu olduğu bir makine öğrenimi ve yapay zeka makalesi olarak tanımlıyor.

Makale, yazarların ortak Transformatör ileri besleme ağı veya FFN katmanlarında tanımladıkları bir sınırlamadan başlamaktadır. Daha önceki tasarımlarda ReLU ve GELU gibi işlevler kullanılırken daha sonraki geçitli tasarımlar SwiGLU'yu içeriyordu ancak kaynak, çoğu FFN'nin hala her tokene sabit, doğrusal olmayan bir dönüşüm uyguladığını söylüyor. Önerilen Aktivasyon Karışımı bunun yerine, değerleri girdiye bağlı olan aktivasyon fonksiyonları ve hafif kapılardan oluşan bir sözlük kullanır. Aynı doğrusal projeksiyonlar paylaşılırken, doğrusal olmayan fonksiyonların karışımı simgeden simgeye değişiklik gösterebilir.

Kaynak aynı zamanda LA olarak kısaltılan öğrenilebilir aktivasyonları girdiden bağımsız bir karşılık olarak tanımlıyor. LA, hem ReLU tipi hem de SwiGLU tipi FFN'lerde aktivasyon fonksiyonlarının doğrusal kombinasyonlarını oluşturur. Yazarlar, sonlu genişlik teorilerinin katı ifade ayrımları oluşturduğunu belirtmektedir: LA kesinlikle sabit aktivasyon FFN'leri içerirken, MoA kesinlikle LA'yı içerir çünkü girdiye bağlı doğrusal olmayan hibridizasyon ekler. Bunlar, katmanların temsil edebileceği işlevlere ilişkin teorik ifade iddialarıdır; konuşlandırılmış bir dil modelinin genellikle daha yetenekli veya güvenilir olduğunun kanıtı değildir.

Deneysel testler için yazarlar, 0,12 milyar ila 2 milyar parametre arasında değişen yoğun ve uzmanların karışımı dil modelleri üzerinde kapsamlı ön eğitim deneyleri yaptıklarını söylüyorlar. Farklı bütçelerini, optimize edicileri ve öğrenme oranı programlarını test ettiklerini rapor ediyorlar. Özete göre MoA, minimum parametre ve hesaplama yüküyle sürekli olarak daha düşük terminal kaybı elde etti ve iyi ayarlanmış taban çizgilerinden daha olumlu ölçeklendirme davranışı gösterdi. Kaynak kaydı, sayısal kayıp farklarını, veri kümelerinin veya temel çizgilerin adlarını, donanım ayrıntılarını veya "minimum" ek yükün kesin anlamını sağlamaz.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

İleri beslemeli katmanlar, birçok dil modelinde parametrelerin ve doğrusal olmayan davranışın büyük bir kısmını içerir. Belirteç uyarlamalı etkinleştirme karıştırma, bilgi işlem veya parametreleri önemli ölçüde artırmadan eğitimi iyileştirirse, model ölçeklendirmeye yönelik etkileri olan nispeten küçük bir mimari değişiklik sunabilir. Kanıtlar yazarların bildirdiği eğitim öncesi deneyleriyle sınırlı kalıyor ve daha iyi bir aşağı yönlü performans veya üretim verimliliği sağlamıyor.

Teklif, mevcut dil modeli mimarisinin önemli bir bölümünü hedef alıyor. Kaynak, FFN katmanlarının model parametrelerinin ve doğrusal olmayan ifadenin büyük bir kısmını oluşturduğunu söylüyor. Bu da onları iyileştirme arayışında önemli bir yer haline getiriyor: Doğrusal olmayan dönüşümde yapılacak bir değişiklik, tamamen farklı bir model ailesi gerektirmek yerine, bir modelin mevcut genişliğini ve projeksiyonlarını ne kadar verimli kullandığını etkileyebilir.

MoA'nın tasarımı potansiyel olarak pratiktir çünkü paylaşılan doğrusal projeksiyonları korur ve hafif, girdiye bağlı geçit ekler. Prensip olarak bu, çevredeki FFN yapısının çoğunu korurken farklı tokenlerin farklı doğrusal olmayan işlemler almasına olanak tanıyabilir. Ancak kaynak, mevcut modellerin yeniden eğitim olmadan yükseltilebileceğini ortaya koymuyor ve eklenen kapıların gerçek dünyadaki verimi, bellek kullanımını veya enerji tüketimini iyileştirip iyileştirmediğini belirlemek için yeterli uygulama ayrıntılarını rapor etmiyor.

Bildirilen daha düşük terminal kaybı konuyla ilgilidir çünkü eğitim kaybı, bir modelin eğitim öncesi verilerine ne kadar iyi uyduğunun merkezi bir ölçüsüdür. İddia edilen ölçeklendirme davranışı, model boyutu veya eğitim hesaplaması arttıkça yöntemin gelişmeye devam etmesi durumunda da önemli olabilir. Ancak nihai kayıp, insanlara fayda sağlamakla aynı şey değildir. Kaynak, gerçekçilik, muhakeme, kodlama, çok dilli performans, güvenlik, kalibrasyon, sağlamlık veya alt görev doğruluğu açısından hiçbir sonuç vermiyor; dolayısıyla rapor edilen eğitim kazanımlarının pratik önemi belirsizliğini koruyor.

Kanıtlar aynı zamanda ön hazırlık niteliğindedir. Gözden geçirilmiş bir ön baskıdan geliyor ve kaynak kaydı, bağımsız doğrulama yerine yazarların teorik ve ampirik sonuçlarını sunuyor. Test edilen aralık 2 milyar parametreyle sona ermektedir; bu, yaygın olarak kullanılan birçok dil modelinden maddi olarak daha küçüktür. Kayıt, deneylerin birden fazla rastgele tohum kullanıp kullanmadığını, taban çizgilerinin nasıl ayarlandığını, yöntemin çıkarım gecikmesini değiştirip değiştirmediğini veya kazanımlarının rapor edilen eğitim öncesi ayarların dışında devam edip etmediğini belirtmiyor.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Bir sonraki önemli kanıt, özellikle test edilen 0,12B ila 2B aralığının ötesinde, bildirilen kazanımların boyutu ve tutarlılığıdır. Okuyucular tam bilgi işlem, bellek, gecikme ve parametre ek yüklerini aramalıdır; aşağı yönlü görevlere ilişkin sonuçlar; bağımsız çoğaltma; ve yöntemin mimariler, veri kümeleri, optimize ediciler ve daha uzun eğitim çalıştırmaları genelinde yararlı olmaya devam ettiğine dair kanıtlar.

Bir sonraki yararlı kontrol niceliksel ayrıntıdır. Tam makale veya daha sonraki çalışma, MoA, LA ve sabit aktivasyon temel hatları için tam kayıp eğrilerini, güven veya çalıştırmadan çalıştırmaya varyasyonu, parametre sayımlarını, işlem sayımlarını, bellek gereksinimlerini ve duvar saati eğitim maliyetlerini göstermelidir. Özet, karşılaştırmaların iyi ayarlanmış temellere göre olduğunu söylediğinden, avantajın eşit olmayan optimizasyondan ziyade mimariden gelip gelmediğine karar vermek için ayarlama prosedürü ve bilgi işlem bütçesi önemli olacaktır.

Ölçek ise çözülmemiş başka bir konudur. Kaynak, 0,12B'den 2B'ye kadar parametrelere sahip modelleri rapor ediyor, ancak aynı modelin büyük ölçüde daha büyük yoğun sistemlerde mi yoksa uzman karışımı sistemlerde mi geçerli olduğunu söylemiyor. Gelecekteki deneyler daha büyük modelleri, daha uzun eğitim çalışmalarını, ek bütçelerini ve farklı veri karışımlarını test etmelidir. Ayrıca iddia edilen olumlu ölçeklendirme davranışının sabit bir hesaplama bütçesindeki kayıpla mı, sabit bir parametre sayısındaki kayıpla mı yoksa başka bir karşılaştırmayla mı ölçüldüğünü de açıklamaları gerekir.

Operasyonel maliyetler yakından ilgiyi hak ediyor. MoA, eklenen parametre ve hesaplama yükü minimum düzeyde tanımlansa bile, belirteç bağımlı bir kapı ve aktivasyon fonksiyonları sözlüğü sunar. Bağımsız ölçümler, bunun hızlandırıcı kullanımında, bellek trafiğinde, toplu işlemde, çıkarım gecikmesinde, eğitim kararlılığında veya enerji kullanımında anlamlı değişiklikler yaratıp yaratmadığını belirlemelidir. Küçük bir teorik ek yük, verimli donanım yürütmeyi kesintiye uğratıyorsa daha büyük bir sistem maliyetine sahip olabilir.

Son olarak okuyucular bağımsız çoğaltma ve daha geniş değerlendirme aramalıdır. Aşağı akış dili, kodlama, akıl yürütme ve çok dilli görevlere ilişkin sonuçlar, daha düşük ön eğitim kaybının kullanıcıların fark ettiği yeteneklere aktarılıp aktarılmadığını gösterecektir. Güvenilirlik ve güvenlik değerlendirmeleri, belirteç uyarlamalı doğrusal olmayan davranışın yeni hata kalıpları oluşturup oluşturmadığını test edecektir. Bu sonuçlar elde edilene kadar, makalenin kanıtlanmış bir üretim iyileştirmesi veya hemen temin edilebilir bir ürün olarak değil, umut verici bir mimari araştırma iddiası olarak anlaşılması en iyisidir.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıTransformatörlerYapay Zeka EğitimiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?