Powrót do Wiadomości
ProduktAI Understanding odprawa

Alibaba wypuszcza Qwen3.8-Omni-Flash do zadań agenta multimodalnego

Alibaba wypuściła Qwen3.8-Omni-Flash, natywny model omnimodalny obsługujący 1 milion tokenów kontekstu, który, jak twierdzi, zapewnia wydajność audio i wideo porównywalną z Gemini 3.8 Flash przy znacznie niższych kosztach API.

5 min readRead the linked source
Source-provided image accompanying Alibaba releases Qwen3.8-Omni-Flash for multimodal agent tasks
Odniesienie do źródłaŹródło zapisane
Wydawca
gigazine.net
Link źródłowy
gigazine.nethttps://gigazine.net/gsc_news/en/20260918-qwen-3-8-omni-flash/
Typ źródła
Źródło powiązane — nie ustalono statusu źródła pierwotnego.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Kluczowe terminy

API (interfejs programowania aplikacji)
Ustrukturyzowany sposób wysyłania żądań przez jeden system oprogramowania i otrzymywania odpowiedzi z innego systemu.
Okno kontekstowe
Maksymalna ilość tokenów wejściowych, które model języka może przetworzyć jednocześnie.
Punkt odniesienia
Standaryzowany test lub zbiór danych używany do pomiaru i porównania wydajności modelu.
Sprawdź sięQuiz objaśniający modele AI

Co się stało

Alibaba wypuściła Qwen3.8-Omni-Flash, nowy model z serii Qwen przeznaczony do przetwarzania omnimodalnego. Model obsługuje okno kontekstowe zawierające 1 milion tokenów i jest przeznaczony dla takich przepływów pracy, jak edycja wideo, produkcja teledysków i rozmowy w czasie rzeczywistym. Według Gigazine model ten przewyższa swojego poprzednika, Qwen3.5-Omni-Plus, średnio o ponad 25% w 29 benchmarkach. Alibaba twierdzi, że nowy model osiąga wydajność audio i wideo bliską lub przewyższającą Gemini 3.8 Flash, jednocześnie zmniejszając koszty API dla wprowadzania głosowego o ponad 98% i wprowadzania głosowego/wideo o ponad 93% w porównaniu z poprzednią wersją. Wydanie zawiera rozszerzenia wtyczek Qwen-MM i uprząż o otwartym kodzie źródłowym o nazwie Qwen-Live Harness, chociaż strona GitHub tego ostatniego była niedostępna w momencie raportowania.

Alibaba dodała Qwen3.8-Omni-Flash do swojej serii Qwen, opisując ją jako natywny model omnimodalny nowej generacji. Model został zaprojektowany do obsługi szerokiego zakresu przepływów pracy, w tym edycji wideo, produkcji teledysków, produkcji filmów, podsumowań audiowizualnych i rozmów w czasie rzeczywistym. Obsługuje okno kontekstowe o pojemności 1 miliona tokenów, co stanowi znaczny wzrost pozwalający na przetwarzanie długich plików audio i wideo.

Według Gigazine model zapewnia lepsze wyniki w porównaniu do swojego poprzednika, Qwen3.5-Omni-Plus. W 29 benchmarkach średni wynik jest o ponad 25% wyższy. Szczególne ulepszenia odnotowano w podstawowych funkcjach, takich jak rozumienie długiego dźwięku, wnioskowanie audio/wideo, napisy i rozpoznawanie wielu głośników. Na przykład uzyskał wynik 82,7 w LongAudioSpan i 89,7 w AliMeeting, benchmarku transkrypcji wieloosobowego, wielokanałowego dźwięku konferencyjnego w języku chińskim.

Alibaba twierdzi, że Qwen3.8-Omni-Flash skaluje dane, kontekst i środowiska agentów, aby osiągnąć wydajność audio i wideo bliską wydajności Gemini 3.8 Flash, a ogólna wydajność dźwięku ją przewyższa. Firma podkreśla znaczne obniżki kosztów, stwierdzając, że koszt API na godzinę w przypadku wprowadzania głosowego jest o ponad 98% niższy, a w przypadku wprowadzania głosu i obrazu o ponad 93% niższy niż w poprzednim modelu. Te zestawienia kosztów mają kluczowe znaczenie dla propozycji wartości modelu dla użytkowników korporacyjnych.

Aby wesprzeć możliwości modelu, Alibaba rozszerzyła wtyczki Qwen-MM, aby dodać percepcję na żądanie, wykorzystanie narzędzi i możliwości wykonywania przepływu pracy dla długich plików audio i wideo. Firma ogłosiła również udostępnienie na zasadach open source Qwen-Live Harness, kompleksowej wiązki zaprojektowanej w oparciu o API Qwen3.8-Omni-Flash-Realtime. Jednakże Gigazine zauważa, że ​​w chwili pisania tego tekstu strona Qwen-Live Harness GitHub nie była dostępna i zwracał błąd 404, wskazując potencjalne opóźnienia lub problemy z publicznym wydaniem tego komponentu.

Szczegóły źródła: gigazine.net ↗

Dlaczego to ma znaczenie

Ta wersja jest istotna, ponieważ uwzględnia wysokie koszty i złożoność przetwarzania długich danych audio i wideo w agentach AI. Twierdząc, że wydajność jest na poziomie porównywalnym za ułamek ceny poprzednich modeli, Alibaba pozycjonuje Qwen3.8-Omni-Flash jako praktyczne narzędzie do zastosowań korporacyjnych, które wymagają wielomodalnego rozumowania w czasie rzeczywistym. Przejście od traktowania dźwięku i obrazu jako prostych danych percepcyjnych do mediów podstawowych na potrzeby rozumowania agentów mogłoby przyspieszyć integrację sztucznej inteligencji z rzeczywistymi scenariuszami produktywności, takimi jak zautomatyzowana produkcja multimediów i złożeni agenci konwersujący. Jednakże konkretne porównania porównawcze z Gemini 3.8 Flash opierają się na twierdzeniach Alibaba i nie zostały niezależnie zweryfikowane przez zewnętrzne osoby oceniające.

Wydanie Qwen3.8-Omni-Flash jest istotne dla branży sztucznej inteligencji, ponieważ skupia się na konkretnym problemie: wysokich kosztach i technicznej złożoności przetwarzania długich danych multimodalnych. Twierdząc, że wydajność na poziomie bliskim granic przy drastycznie obniżonych kosztach, Alibaba kwestionuje status quo cen i dostępności multimodalnej sztucznej inteligencji. Może to doprowadzić do szerszego zastosowania agentów sztucznej inteligencji w branżach, które w dużym stopniu opierają się na danych audio i wideo, takich jak produkcja multimediów, obsługa klienta i tłumaczenia w czasie rzeczywistym.

Zdolność modelu do obsługi 1 miliona tokenów kontekstu stanowi duży postęp techniczny, ponieważ pozwala na przetwarzanie znacznie dłuższych plików audio i wideo bez segmentacji. Ma to kluczowe znaczenie w zastosowaniach takich jak produkcja filmów lub transkrypcja długich spotkań, gdzie niezbędna jest ciągłość kontekstu. Poprawa rozpoznawania wielu głośników i rozumienia długiego dźwięku sugeruje, że model lepiej nadaje się do złożonych, rzeczywistych scenariuszy niż poprzednie iteracje.

Jednakże twierdzenia o wydajności większej lub dorównującej Gemini 3.8 Flash opierają się na wewnętrznych testach Alibaba i nie zostały niezależnie zweryfikowane. Jest to częsty problem w branży sztucznej inteligencji, gdzie firmy często polegają na danych zgłaszanych przez siebie. Niezależne oceny będą konieczne, aby potwierdzić rzeczywistą wydajność i opłacalność modelu. Do tego czasu przedsiębiorstwa powinny podchodzić do roszczeń z ostrożnością i przeprowadzać własne testy przed dokonaniem znaczących inwestycji.

Otwarte oprogramowanie Qwen-Live Harness jest pozytywnym krokiem dla społeczności programistów, ponieważ zapewnia ramy do tworzenia aplikacji na podstawie modelu. Jednakże niedostępność strony GitHub w momencie raportowania jest sygnałem ostrzegawczym, który może opóźnić przyjęcie. Programiści będą musieli poczekać, aż uprząż będzie w pełni dostępna i stabilna, zanim będą mogli rozpocząć tworzenie aplikacji gotowych do produkcji.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktywna kontrola koncepcji+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Co obejrzeć dalej

Programiści powinni monitorować dostępność i stabilność wiązki przewodów Qwen-Live, ponieważ źródło zauważa, że ​​strona GitHub zwróciła błąd 404. Dodatkowo niezależne testy porównawcze porównujące Qwen3.8-Omni-Flash z innymi pionierskimi modelami, takimi jak Gemini 3.8 Flash, będą miały kluczowe znaczenie dla potwierdzenia twierdzeń Alibaba o wydajności. Praktyczny wpływ na ceny API dla zadań multimodalnych będzie również kluczowym czynnikiem dla przedsiębiorstw rozważających wdrożenie.

Dostępność i stabilność uprzęży Qwen-Live Harness będą kluczowymi czynnikami decydującymi o przyjęciu tego modelu. Jeśli strona GitHub pozostanie niedostępna lub jeśli wiązka zawiera istotne błędy, może to uniemożliwić programistom tworzenie aplikacji na bazie Qwen3.8-Omni-Flash. Niezbędne będzie monitorowanie repozytorium GitHub i wszelkich aktualizacji z Alibaba.

Niezależne testy porównawcze porównujące Qwen3.8-Omni-Flash z innymi pionierskimi modelami, takimi jak Gemini 3.8 Flash i GPT-4o, będą miały kluczowe znaczenie dla potwierdzenia twierdzeń Alibaba o wydajności. Oceny stron trzecich zapewnią bardziej obiektywny obraz możliwości modelu i pomogą przedsiębiorstwom w podejmowaniu świadomych decyzji o przyjęciu.

Kluczowym czynnikiem będzie także praktyczny wpływ na ceny API dla zadań multimodalnych. Jeśli obniżki kosztów, o których twierdzi Alibaba, zostaną zrealizowane, może to doprowadzić do znacznych zmian na rynku, czyniąc multimodalną sztuczną inteligencję bardziej dostępną dla mniejszych firm i programistów. Ważne będzie monitorowanie rzeczywistych kosztów API i porównywanie ich z konkurencją.

Wydajność modelu w rzeczywistych scenariuszach, takich jak edycja wideo i rozmowy w czasie rzeczywistym, będzie kluczowym wskaźnikiem jego praktycznej użyteczności. Informacje zwrotne od użytkowników i studia przypadków od pierwszych użytkowników dostarczą cennych informacji na temat mocnych i ograniczeń modelu.

Powiązane przewodniki i quizy

Wyjaśnienie modeli AIAgenci AICzym jest sztuczna inteligencja?Sprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie z modułem śledzenia wydań modeli AI
Uznałeś to za przydatne?