Ne oldu?
Apple Makine Öğrenimi Araştırması, aralıklı metin-görüntü dizilerini anlamak, üzerinde düşünmek ve oluşturmak için oluşturulmuş çok modlu üretken bir mimari olan STARFlow2'yi açıklayan bir makale yayınladı. Yazarlar, sistemin önceden eğitilmiş bir görüş dili modelinin yanı sıra otoregresif normalleştirme akışlarını kullandığını ve her iki akışın da aynı nedensel yapı altında çalıştığını söylüyor. Apple, görüntü oluşturma ve multimodal anlama kıyaslamalarında güçlü sonuçlar bildiriyor ancak kaynak, kıyaslama adları, puanlar veya karşılaştırmalar sunmuyor.
Apple Makine Öğrenimi Araştırması'nın Ağustos 2026'da yayınlandığı belirtilen sayfası, STARFlow2'yi birleşik çok modlu nesile yönelik bir araştırma olarak sunuyor. Bu makale, metin ve görsellerin serpiştirildiği dizileri işleyebilen ve üretebilen sistemleri ele almaktadır. Apple'nin yazarları mevcut yaklaşımların yapısal olarak parçalı olduğunu öne sürüyor: Bazıları görsel doğruluğu azaltabilecek ayrık görsel tokenizasyona dayanıyor, bazıları nedensel dil üretimini yinelemeli yayılma gürültü gidermeyle birleştiriyor ve bazıları da önceden eğitilmiş anlayışlarını zayıflatabilecek şekillerde görme dili modellerini nesile uyarlıyor. Bunlar, bu kaynak tarafından sağlanan bağımsız olarak belirlenmiş bulgular değil, makalenin mevcut yaklaşımlara ilişkin tanımlamalarıdır.
Ana öneri, otoregresif normalleştirme akışlarını dil ve görsel çıktılar için ortak bir üretken çerçeve olarak kullanmaktır. Bildirilen mimari, gazetenin Pretzel tasarımı olarak adlandırdığı yapıya dayanıyor. Dikey olarak iki akışı birbirine karıştırır: dondurulmuş, önceden eğitilmiş bir görüş dili modeli akışı ve bir TARFlow akışı. Artık atlama bağlantıları akışları birbirine bağlar ve her ikisi de aynı nedensel maske altında çalışır. Kaynak, otoregresif normalleştirme akışlarını, nedensel bir maskeyi, anahtar-değer-önbellek mekanizmasını ve soldan sağa yapıyı büyük dil modelleriyle paylaşan otoregresif Transformatörler olarak tanımlıyor.
STARFlow2 ayrıca derin sığ akış tasarımını birleşik FAE gizli alanıyla birleştirir. Apple, bunun, metin ve görsel çıktıların yeniden kodlanmak yerine doğrudan anahtar/değer önbelleğine girmesiyle sistemin aralıklı içeriği önbellek dostu bir şekilde oluşturmasına olanak tanıdığını söylüyor. Sayfada, deneylerin görüntü oluşturma ve çok modlu anlama kriterlerinde güçlü performans gösterdiği belirtiliyor; Apple, otoregresif akışların birleşik çok modlu modelleme için bir temel görevi görebileceğinin doğrulaması olarak sunuyor. Ancak sağlanan kaynak; kıyaslamaları, rapor puanlarını, karşılaştırma sistemlerini adlandırmıyor, veri kümelerini tanımlamıyor veya hesaplama maliyetini belirtmiyor. Ayrıca modelin, kodun, ağırlıkların veya etkileşimli gösterimin mevcut olup olmadığı da belirtilmez. Sayfa, normalleştirme akışlarıyla video oluşturmayla ilgili çalışmaları listeliyor, ancak bu çalışma STARFlow2 duyurusundan ayrı. Sağlanan kanıtlara göre bu bir araştırma sonucu ve mimari tekliftir; bir ürün lansmanı veya kanıtlanmış bir kamu hizmeti değildir.
Kaynak ayrıntıları: machinelearning.apple.com ↗
Neden önemli?
Çalışma, çok modlu yapay zekadaki yapısal bir sorunu hedef alıyor: Dil modelleri tipik olarak ayrı belirteçler üretirken, görüntüler sürekli verilerdir ve genellikle ayrı yayılma veya yinelemeli sistemler aracılığıyla üretilir. Bildirilen tasarım geçerliyse, tek bir nedensel mekanizma çok modlu oluşturmayı basitleştirebilir ve aralıklı metin-görüntü sistemlerinin hizmet vermesini kolaylaştırabilir. Kaynak gecikme, maliyet, kalite veya kullanılabilirlik verileri vermediğinden pratik değeri doğrulanmadı.
STARFlow2'nin pratik önemi, dil ve görsel üretim arasındaki uyumsuzluğu tek bir model yapısı içinde gidermeye çalışmasıdır. Makalenin açıklamasında, dil üretimi doğal olarak soldan sağa doğru bir süreç olarak ele alınırken, görüntü üretimi genellikle ayrı bir temsil veya yinelemeli bir gürültü giderme prosedürü aracılığıyla gerçekleştirilir. Apple'nin önerilen akış temelli yaklaşımı, her iki yöntemi de sürekli, nedensel bir sıra içinde tutmayı amaçlamaktadır. Bağımsız değerlendirmeler iddiayı doğrularsa, bu durum araştırmacılara bir görüntüyü tanımlama, oluşturma, yorumlama ve metinle devam etme arasında geçiş yapması gereken uygulamalar için daha tutarlı bir tasarım sunabilir.
Önbellek tasarımı başka bir potansiyel yararlı katkıdır. Apple, metin ve görsel çıktıların yeniden kodlamaya gerek kalmadan doğrudan anahtar/değer önbelleğine girebileceğini söylüyor. Prensip olarak bu, özellikle uzun aralıklı konuşmalarda veya oluşturma görevlerinde, bir sistem modaliteler arasında tekrar tekrar hareket ettiğinde yinelenen işlemleri azaltabilir. Ancak kaynak etkiyi ölçmüyor. Bildirilen herhangi bir gecikme ölçümü, bellek rakamı, üretim sonucu, hizmet maliyeti veya eşdeğer bir yayılma tabanlı veya tokenize edilmiş sistemle karşılaştırma yoktur. Bu nedenle iddia edilen avantaj, yerleşik bir operasyonel faydadan ziyade mimari bir amaç ve araştırma iddiası olarak ele alınmalıdır.
Teklif aynı zamanda yüksek doğrulukta sürekli görüntü üretimi eklerken, önceden eğitilmiş bir modelin çok modlu anlayışını korumaya çalıştığı için de önemlidir. Apple, donmuş görüntü dili akışının mevcut anlayışın korunmasına yardımcı olduğunu ve akış akışının görsel üretimi mümkün kıldığını söylüyor. Bu kombinasyon, hem yorumlamaya hem de yaratmaya ihtiyaç duyan gelecekteki sistemlerle ilgili olabilir, ancak kaynak, anlayışın ne kadarının korunduğunu, görsel doğruluğun nasıl ölçüldüğünü veya bir görevdeki kazanımların diğerindeki performansla değişip değişmediğini ortaya koymuyor. Makalenin sonuçları çok modelli araştırma için önemli olabilir, ancak bunların daha geniş önemi duyuruda bulunmayan ayrıntılara bağlıdır.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
Which component of an AI application is the machine-learning model itself?
Bundan sonra ne izlenecek?
Bir sonraki anahtar kanıt, kıyaslama ayrıntıları, taban çizgileri, ablasyonlar, model boyutu, hesaplama gereksinimleri ve tüm kod veya ağırlıklar dahil olmak üzere tam yayındır. Araştırmacılar ve geliştiriciler ayrıca iddia edilen KV önbellek avantajlarının uzun aralıklı dizilerde ve gerçek çok modlu iş akışlarında devam edip etmediğini test etmelidir. Apple bu kaynakta STARFlow2'nin bir ürün, halka açık bir model veya genel olarak mevcut bir araç olduğunu söylememiştir ve Ağustos 2026'daki kesin yayın tarihi belirtilmemiştir.
İlk doğrulama noktası makalenin tamamı ve deneysel kaydıdır. Yararlı takip kanıtları, görüntü oluşturma ve çok modlu anlama kriterlerinin adlarını ve versiyonlarını, STARFlow2 için sayısal sonuçları ve ilgili temel çizgileri, donmuş görüş dili akışını, TARFlow akışını, kalan bağlantıları ve gizli alan tasarımını ayıran ablasyon çalışmalarını ve eğitim verileri, model boyutu ve hesaplama hakkındaki ayrıntıları içerecektir. Bu ayrıntılar olmadan "güçlü performans", iyileşmenin ne kadar büyük veya güvenilir olduğunu belirlemek için çok geniş kapsamlı olacaktır.
İkinci soru, önerilen nedensel ve önbellek dostu yapının bildirilen testlerin ötesinde işe yarayıp yaramadığıdır. Önbellek büyümesi, bellek kullanımı ve hata birikimi pratik performansı etkileyebileceğinden, bağımsız araştırmacıların metin ve görseller arasında tekrarlanan geçişler içeren uzun dizileri incelemesi gerekecektir. Ayrıca çıktı kalitesini, tutarlılığını, kontrol edilebilirliğini ve hizmet maliyetini ayrı görüntü belirteçleri veya yinelemeli yayılım kullanan sistemlerle karşılaştırmaları gerekir. Kaynak henüz bu ödünleşimler hakkında hiçbir kanıt sunmuyor ve dağıtım değişimleri ya da zor çok modlu yönlendirmeler altındaki davranışları da rapor etmiyor.
Son soru dağıtımdır. Kaynak, STARFlow2'nin bir Apple ürünü, API, araştırma deposu veya indirilebilir kontrol noktası aracılığıyla kullanılabildiğini belirtmiyor. Aynı zamanda kesin bir yayın günü de sağlamadığından, belirtilen 96 saatlik haber penceresi içindeki zamanlama, sağlanan materyalden daha fazla daraltılamaz. Takip raporlaması, Apple'nin uygulama ayrıntılarını veya model yapıtlarını yayınlayıp yayınlamadığını, dış grupların sonuçları yeniden üretip üretemeyeceğini ve mimarinin ticari çok modlu sistemleri etkileyip etkilemediğini belirlemelidir. O zamana kadar anlamlı bilinmeyenler; kullanılabilirlik, tekrarlanabilirlik, kaynak gereksinimleri ve bağımsız olarak ölçülen kazançlardır.