Haberlere Geri Dön
ÜrünAI Understanding brifing

Alibaba, çok modlu temsilci görevleri için Qwen3.8-Omni-Flash'ı piyasaya sürdü

Alibaba, önemli ölçüde daha düşük API maliyetleriyle Gemini 3.8 Flash ile karşılaştırılabilir ses ve video performansı elde ettiğini iddia ettiği, 1 milyon bağlam belirtecini destekleyen yerel çok modlu bir model olan Qwen3.8-Omni-Flash'ı piyasaya sürdü.

5 min readRead the linked source
Source-provided image accompanying Alibaba releases Qwen3.8-Omni-Flash for multimodal agent tasks
Kaynak referansıKaynak kaydedildi
Yayıncı
gigazine.net
Kaynak bağlantısı
gigazine.nethttps://gigazine.net/gsc_news/en/20260918-qwen-3-8-omni-flash/
Kaynak türü
Bağlantılı kaynak — birincil kaynak durumu belirlenmedi.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

API (Uygulama Programlama Arayüzü)
Bir yazılım sisteminin başka bir sisteme istek göndermesi ve bu sistemden yanıt alması için yapılandırılmış bir yol.
Bağlam Penceresi
Bir dil modelinin aynı anda işleyebileceği maksimum giriş belirteci miktarı.
Karşılaştırma
Model performansını ölçmek ve karşılaştırmak için kullanılan standartlaştırılmış bir test veya veri kümesi.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Alibaba, Qwen serisinde omnimodal işleme için tasarlanan yeni bir model olan Qwen3.8-Omni-Flash'ı piyasaya sürdü. Model, 1 milyon token içerik penceresini destekliyor ve video düzenleme, müzik videosu prodüksiyonu ve gerçek zamanlı konuşma gibi iş akışlarını hedefliyor. Gigazine'e göre model, selefi Qwen3.5-Omni-Plus'ı 29 kıyaslamada ortalama %25'in üzerinde bir oranla geride bırakıyor. Alibaba, yeni modelin Gemini 3.8 Flash'a yakın veya daha yüksek ses ve video performansı elde ettiğini, ses girişi için API maliyetlerini önceki sürüme kıyasla %98'in üzerinde ve ses/video girişinin %93'ün üzerinde azalttığını iddia ediyor. Sürüm, Qwen-MM-Eklentilerine yönelik uzantıları ve Qwen-Live Harness adı verilen açık kaynaklı bir donanım içerir, ancak ikincisinin GitHub sayfasına raporlama sırasında erişilemezdi.

Alibaba, Qwen serisine Qwen3.8-Omni-Flash'ı ekleyerek onu yeni nesil yerel omnimodal model olarak tanımladı. Model, video düzenleme, müzik videosu prodüksiyonu, film prodüksiyonu, görsel-işitsel özetleme ve gerçek zamanlı konuşma dahil olmak üzere çok çeşitli iş akışlarını idare edecek şekilde tasarlandı. 1 milyon jetonluk bir bağlam penceresini destekler; bu, uzun biçimli ses ve video dosyalarının işlenmesine olanak tanıyan önemli bir artıştır.

Gigazine'e göre model, selefi Qwen3.5-Omni-Plus'a kıyasla üstün sonuçlar veriyor. 29 kıyaslama genelinde ortalama puanın %25'ten fazla daha yüksek olduğu bildiriliyor. Uzun sesi anlama, ses/video çıkarımı, altyazı ekleme ve çoklu konuşmacı tanıma gibi temel işlevlerde belirli iyileştirmeler kaydedildi. Örneğin, LongAudioSpan'da 82,7 ve çok kişili, çok kanallı konferans sesinin Çince olarak yazıya geçirilmesinde bir ölçüt olan AliMeeting'de 89,7 puan elde etti.

Alibaba, Qwen3.8-Omni-Flash'ın Gemini 3.8 Flash'a yakın ses ve video performansı elde etmek için verileri, bağlamı ve aracı ortamlarını ölçeklendirdiğini ve genel ses performansının onu aştığını iddia ediyor. Şirket, ses girişi için saat başına API maliyetinin %98'in üzerinde, ses ve video girişi için ise önceki modele göre %93'ün üzerinde daha düşük olduğunu belirterek önemli maliyet düşüşlerinin altını çiziyor. Bu maliyet talepleri, modelin kurumsal kullanıcılar için sunduğu değer teklifinin merkezinde yer alır.

Modelin yeteneklerini desteklemek amacıyla Alibaba, uzun ses ve video için isteğe bağlı algı, araç kullanımı ve iş akışı yürütme yeteneklerini eklemek üzere Qwen-MM-Eklentilerini genişletti. Şirket ayrıca Qwen3.8-Omni-Flash-Realtime API'sine dayalı olarak tasarlanan kapsamlı bir donanım olan Qwen-Live Harness'ın açık kaynak kullanımını da duyurdu. Ancak Gigazine, bu yazının yazıldığı sırada Qwen-Live Harness GitHub sayfasına erişilemediğini ve bu bileşenin halka açık sürümüyle ilgili olası gecikmelere veya sorunlara işaret eden bir 404 hatası döndürdüğünü belirtiyor.

Kaynak ayrıntıları: gigazine.net ↗

Neden önemli?

Bu sürüm önemlidir çünkü yapay zeka aracılarında uzun biçimli ses ve video verilerinin işlenmesinin yüksek maliyetini ve karmaşıklığını giderir. Alibaba, önceki modellerin maliyetinin çok altında bir maliyetle sınıra yakın performans iddiasında bulunarak, Qwen3.8-Omni-Flash'ı gerçek zamanlı çok modlu akıl yürütme gerektiren kurumsal uygulamalar için pratik bir araç olarak konumlandırıyor. Temsilci muhakemesi için ses ve videoyu basit algısal girdiler olarak ele almaktan çekirdek medyaya geçiş, yapay zekanın otomatik medya üretimi ve karmaşık konuşma aracıları gibi gerçek dünya üretkenlik senaryolarına entegrasyonunu hızlandırabilir. Ancak Gemini 3.8 Flash ile yapılan spesifik kıyaslama karşılaştırmaları Alibaba'nın iddialarına dayanmaktadır ve üçüncü taraf değerlendiriciler tarafından bağımsız olarak doğrulanmamıştır.

Qwen3.8-Omni-Flash'ın piyasaya sürülmesi yapay zeka endüstrisi için önemli çünkü belirli bir sıkıntı noktasını hedefliyor: uzun biçimli çok modlu verilerin işlenmesinin yüksek maliyeti ve teknik karmaşıklığı. Alibaba, büyük ölçüde azaltılmış bir maliyetle sınıra yakın performans iddiasında bulunarak, çok modlu yapay zeka fiyatlandırması ve erişilebilirliği konusundaki statükoya meydan okuyor. Bu, medya prodüksiyonu, müşteri hizmetleri ve gerçek zamanlı çeviri gibi ağırlıklı olarak ses ve video verilerine dayanan sektörlerde yapay zeka aracılarının daha geniş çapta benimsenmesine yol açabilir.

Modelin 1 milyon jetonluk bağlamı işleme yeteneği, çok daha uzun ses ve video dosyalarının segmentasyona gerek kalmadan işlenmesine olanak tanıdığı için büyük bir teknik ilerlemedir. Bu, bağlam sürekliliğinin önemli olduğu film prodüksiyonu veya uzun süreli toplantı transkripsiyonları gibi uygulamalar için çok önemlidir. Çoklu konuşmacı tanıma ve uzun ses anlamadaki gelişme, modelin karmaşık, gerçek dünya senaryoları için önceki versiyonlara göre daha uygun olduğunu gösteriyor.

Ancak Gemini 3.8 Flash'tan daha iyi performans gösterdiği veya onunla eşleştiği yönündeki iddialar Alibaba'nın dahili kıyaslamalarına dayanmaktadır ve bağımsız olarak doğrulanmamıştır. Bu, şirketlerin genellikle kendilerinin bildirdiği ölçümlere güvendiği yapay zeka endüstrisinde yaygın bir sorundur. Modelin gerçek performansını ve maliyet etkinliğini doğrulamak için bağımsız değerlendirmeler gerekli olacaktır. O zamana kadar işletmelerin iddialara temkinli yaklaşması ve önemli yatırımlar yapmadan önce kendi testlerini yapması gerekiyor.

Qwen-Live Harness'ın açık kaynak kullanımı, modelin üzerine uygulamalar oluşturmak için bir çerçeve sağladığından geliştirici topluluğu için olumlu bir adımdır. Ancak raporlama sırasında GitHub sayfasına erişilememesi, benimsenmeyi geciktirebilecek bir tehlike işaretidir. Geliştiricilerin, üretime hazır uygulamalar oluşturmaya başlamadan önce donanımın tamamen kullanılabilir ve kararlı olmasını beklemeleri gerekecek.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Kaynak, GitHub sayfasının 404 hatası döndürdüğünü belirttiğinden, geliştiricilerin Qwen-Live Harness'ın kullanılabilirliğini ve kararlılığını izlemesi gerekiyor. Ek olarak, Qwen3.8-Omni-Flash'ı Gemini 3.8 Flash gibi diğer öncü modellerle karşılaştıran bağımsız kıyaslamalar, Alibaba'nın performans iddialarını doğrulamak için çok önemli olacak. Çok modlu görevler için API fiyatlandırması üzerindeki pratik etki, benimsemeyi düşünen kuruluşlar için de önemli bir faktör olacaktır.

Qwen-Live Harness'ın kullanılabilirliği ve istikrarı, modelin benimsenmesinde önemli bir faktör olacaktır. GitHub sayfasına erişilemez durumda kalırsa veya donanımda önemli hatalar varsa, bu durum geliştiricilerin Qwen3.8-Omni-Flash üzerinde uygulamalar oluşturmasını engelleyebilir. GitHub deposunun ve Alibaba'dan gelen güncellemelerin izlenmesi önemli olacaktır.

Qwen3.8-Omni-Flash'ı Gemini 3.8 Flash ve GPT-4o gibi diğer öncü modellerle karşılaştıran bağımsız kıyaslamalar, Alibaba'nın performans iddialarını doğrulamak için çok önemli olacak. Üçüncü taraf değerlendirmeleri, modelin yeteneklerine ilişkin daha objektif bir bakış açısı sağlayacak ve kuruluşların benimseme konusunda bilinçli kararlar almasına yardımcı olacaktır.

Çok modlu görevler için API fiyatlandırması üzerindeki pratik etki de önemli bir faktör olacaktır. Alibaba'nın iddia ettiği maliyet düşüşleri gerçekleşirse, pazarda önemli bir değişime yol açabilir ve çok modlu yapay zekayı küçük şirketler ve geliştiriciler için daha erişilebilir hale getirebilir. Gerçek API maliyetlerini izlemek ve bunları rakiplerle karşılaştırmak önemli olacaktır.

Modelin video düzenleme ve gerçek zamanlı konuşma gibi gerçek dünya senaryolarındaki performansı, pratik faydasının önemli bir göstergesi olacak. Kullanıcı geri bildirimleri ve ilk benimseyenlerin örnek olay çalışmaları, modelin güçlü yönleri ve sınırlamaları hakkında değerli bilgiler sağlayacaktır.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıYapay Zeka AracılarıAI nedir?Bildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?