Înapoi la Știri
ProdusAI Understanding briefing

Alibaba lansează Qwen3.8-Omni-Flash pentru sarcini de agenți multimodali

Alibaba a lansat Qwen3.8-Omni-Flash, un model omnimodal nativ care acceptă 1 milion de simboluri de context, despre care susține că atinge performanțe audio și video comparabile cu Gemini 3.8 Flash la costuri API semnificativ mai mici.

5 min readRead the linked source
Source-provided image accompanying Alibaba releases Qwen3.8-Omni-Flash for multimodal agent tasks
Referință la sursăSursa înregistrată
Editor
gigazine.net
Link sursă
gigazine.nethttps://gigazine.net/gsc_news/en/20260918-qwen-3-8-omni-flash/
Tip sursă
Sursă conectată — starea sursei primare nu a fost stabilită.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

API (Interfață de programare a aplicației)
O modalitate structurată pentru ca un sistem software să trimită cereri și să primească răspunsuri de la un alt sistem.
Fereastra de context
Cantitatea maximă de jetoane de intrare pe care un model de limbă poate procesa simultan.
Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Testează-teTest explicativ pentru modelele AI

Ce sa întâmplat

Alibaba a lansat Qwen3.8-Omni-Flash, un model nou din seria sa Qwen, conceput pentru procesare omnimodală. Modelul acceptă o fereastră de context de 1 milion de simboluri și vizează fluxuri de lucru precum editarea video, producția de videoclipuri muzicale și conversația în timp real. Potrivit Gigazine, modelul îl depășește pe predecesorul său, Qwen3.5-Omni-Plus, cu peste 25% în medie în 29 de -uri. Alibaba susține că noul model atinge performanțe audio și video apropiate sau depășind Gemini 3.8 Flash, reducând în același timp costurile API pentru intrarea vocală cu peste 98% și intrarea voce/video cu peste 93% în comparație cu versiunea anterioară. Versiunea include extensii la Qwen-MM-Plugins și un cablaj open-source numit Qwen-Live Harness, deși pagina GitHub a acestuia din urmă era inaccesibilă în momentul raportării.

Alibaba a adăugat Qwen3.8-Omni-Flash la seria sa Qwen, descriindu-l ca un model ommodal nativ de generație următoare. Modelul este conceput pentru a gestiona o gamă largă de fluxuri de lucru, inclusiv editare video, producție de videoclipuri muzicale, producție de filme, rezumare audiovizuală și conversație în timp real. Acceptă o fereastră de context de 1 milion de jetoane, ceea ce reprezintă o creștere substanțială care permite procesarea fișierelor audio și video de lungă durată.

Potrivit Gigazine, modelul oferă rezultate superioare în comparație cu predecesorul său, Qwen3.5-Omni-Plus. În 29 de puncte de referință, scorul mediu este raportat a fi cu peste 25% mai mare. Îmbunătățiri specifice sunt observate în funcțiile de bază, cum ar fi înțelegerea sunetului lung, inferența audio/video, subtitrărea și recunoașterea mai multor difuzoare. De exemplu, a obținut un scor de 82,7 în LongAudioSpan și 89,7 în AliMeeting, un punct de referință pentru transcrierea audio pentru conferințe multi-persoană și multicanal în chineză.

Alibaba susține că Qwen3.8-Omni-Flash scala datele, contextul și mediile de agenți pentru a obține performanțe audio și video apropiate de cele ale Gemini 3.8 Flash, cu performanța audio generală depășind-o. Compania evidențiază reduceri semnificative ale costurilor, afirmând că costul API pe oră pentru intrarea vocală este cu peste 98% mai mic, iar pentru intrarea voce și video, este cu peste 93% mai mic decât modelul anterior. Aceste afirmații de cost sunt esențiale pentru propunerea de valoare a modelului pentru utilizatorii întreprinderilor.

Pentru a sprijini capacitățile modelului, Alibaba a extins Qwen-MM-Plugins pentru a adăuga percepția la cerere, utilizarea instrumentelor și capabilități de execuție a fluxului de lucru pentru audio și video lung. Compania a anunțat, de asemenea, achiziționarea Qwen-Live Harness, un ham cuprinzător proiectat pe baza API-ului Qwen3.8-Omni-Flash-Realtime. Cu toate acestea, Gigazine notează că, la momentul scrierii, pagina Qwen-Live Harness GitHub nu era accesibilă și a returnat o eroare 404, indicând potențiale întârzieri sau probleme cu lansarea publică a acestei componente.

Detalii sursa: gigazine.net ↗

De ce contează

Această versiune este semnificativă deoarece abordează costul ridicat și complexitatea procesării datelor audio și video de formă lungă în agenții AI. Afirmând performanțe aproape de frontieră la o fracțiune din costul modelelor anterioare, Alibaba poziționează Qwen3.8-Omni-Flash ca un instrument practic pentru aplicațiile de întreprindere care necesită raționament multimodal în timp real. Trecerea de la tratarea audio și video ca simple intrări perceptuale la media de bază pentru raționamentul agentului ar putea accelera integrarea AI în scenarii de productivitate din lumea reală, cum ar fi producția media automată și agenți conversaționali complexi. Cu toate acestea, comparațiile specifice de referință cu Gemini 3.8 Flash se bazează pe afirmațiile Alibaba și nu au fost verificate în mod independent de către evaluatori terți.

Lansarea Qwen3.8-Omni-Flash este semnificativă pentru industria AI, deoarece vizează un punct de durere specific: costul ridicat și complexitatea tehnică a procesării datelor multimodale de formă lungă. Reclamând performanțe aproape de frontieră la un cost redus drastic, Alibaba contestă status quo-ul prețurilor și accesibilității AI multimodale. Acest lucru ar putea duce la o adoptare mai largă a agenților AI în industriile care se bazează în mare măsură pe date audio și video, cum ar fi producția media, serviciul pentru clienți și traducerea în timp real.

Capacitatea modelului de a gestiona 1 milion de simboluri de context este un progres tehnic major, deoarece permite procesarea fișierelor audio și video mult mai lungi fără segmentare. Acest lucru este esențial pentru aplicații precum producția de film sau transcrierea întâlnirilor de lungă durată, în care continuitatea contextului este esențială. Îmbunătățirea recunoașterii cu mai multe difuzoare și înțelegerea lungă a sunetului sugerează că modelul este mai potrivit pentru scenarii complexe, din lumea reală decât iterațiile anterioare.

Cu toate acestea, afirmațiile privind performanța sau egalitatea Gemini 3.8 Flash se bazează pe -urile interne ale Alibaba și nu au fost verificate independent. Aceasta este o problemă comună în industria AI, unde companiile se bazează adesea pe valorile auto-raportate. Evaluările independente vor fi necesare pentru a confirma performanța reală și rentabilitatea modelului. Până atunci, întreprinderile ar trebui să abordeze afirmațiile cu prudență și să își efectueze propriile teste înainte de a face investiții semnificative.

Aprovizionarea Qwen-Live Harness este un pas pozitiv pentru comunitatea de dezvoltatori, deoarece oferă un cadru pentru construirea de aplicații pe deasupra modelului. Cu toate acestea, inaccesibilitatea paginii GitHub la momentul raportării este un semnal roșu care ar putea întârzia adoptarea. Dezvoltatorii vor trebui să aștepte ca cablajul să fie complet disponibil și stabil înainte de a putea începe să construiască aplicații pregătite pentru producție.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Ce să urmărești în continuare

Dezvoltatorii ar trebui să monitorizeze disponibilitatea și stabilitatea Harness-ului Qwen-Live, deoarece sursa notează că pagina sa GitHub a returnat o eroare 404. În plus, -urile independente care compară Qwen3.8-Omni-Flash cu alte modele de frontieră precum Gemini 3.8 Flash vor fi cruciale pentru a valida afirmațiile de performanță ale Alibaba. Impactul practic asupra prețurilor API pentru sarcini multimodale va fi, de asemenea, un factor cheie pentru întreprinderile care iau în considerare adoptarea.

Disponibilitatea și stabilitatea hamului Qwen-Live va fi un factor cheie în adoptarea modelului. Dacă pagina GitHub rămâne inaccesibilă sau dacă cablajul are erori semnificative, ar putea împiedica dezvoltatorii să construiască aplicații pe Qwen3.8-Omni-Flash. Monitorizarea depozitului GitHub și a oricăror actualizări de la Alibaba va fi esențială.

-urile independente care compară Qwen3.8-Omni-Flash cu alte modele de frontieră, cum ar fi Gemini 3.8 Flash și GPT-4o, vor fi cruciale pentru a valida afirmațiile de performanță ale Alibaba. Evaluările de la terți vor oferi o perspectivă mai obiectivă asupra capacităților modelului și vor ajuta întreprinderile să ia decizii informate cu privire la adoptare.

Impactul practic asupra prețurilor API pentru sarcini multimodale va fi, de asemenea, un factor cheie. Dacă se realizează reducerile de costuri revendicate de Alibaba, ar putea duce la o schimbare semnificativă a pieței, făcând AI multimodală mai accesibilă companiilor și dezvoltatorilor mai mici. Monitorizarea costurilor reale API și compararea acestora cu concurenții va fi importantă.

Performanța modelului în scenarii din lumea reală, cum ar fi editarea video și conversația în timp real, va fi un indicator cheie al utilității sale practice. Feedback-ul utilizatorilor și studiile de caz de la cei care adoptă timpuriu vor oferi informații valoroase asupra punctelor forte și limitărilor modelului.

Ghiduri și chestionare conexe

Modelele AI explicateAgenți AICe este AI?Testați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?