Zurück zu den Neuigkeiten
ProduktAI Understanding Briefing

Alibaba veröffentlicht Qwen3.8-Omni-Flash für multimodale Agentenaufgaben

Alibaba hat Qwen3.8-Omni-Flash veröffentlicht, ein natives omnimodales Modell, das 1 Million Kontext-Tokens unterstützt und angeblich eine mit Gemini 3.8 Flash vergleichbare Audio- und Videoleistung bei deutlich geringeren API-Kosten erreicht.

5 min readRead the linked source
Source-provided image accompanying Alibaba releases Qwen3.8-Omni-Flash for multimodal agent tasks
QuellenangabeQuelle aufgezeichnet
Herausgeber
gigazine.net
Quelllink
gigazine.nethttps://gigazine.net/gsc_news/en/20260918-qwen-3-8-omni-flash/
Quelltyp
Verknüpfte Quelle – Der Status der Primärquelle wurde nicht festgelegt.
KontextVerstehen Sie dies in 60 Sekunden

Beginnen Sie hier

Schlüsselbegriffe

API (Anwendungsprogrammierschnittstelle)
Eine strukturierte Möglichkeit für ein Softwaresystem, Anfragen an ein anderes System zu senden und Antworten von diesem zu empfangen.
Kontextfenster
Die maximale Anzahl an Eingabetokens, die ein Sprachmodell gleichzeitig verarbeiten kann.
Benchmark
Ein standardisierter Test oder Datensatz zum Messen und Vergleichen der Modellleistung.
Testen Sie sich selbstKI-Modelle erklärt Quiz

Was ist passiert?

Alibaba hat Qwen3.8-Omni-Flash veröffentlicht, ein neues Modell seiner Qwen-Serie, das für die omnimodale Verarbeitung konzipiert ist. Das Modell unterstützt ein 1-Millionen-Token-Kontextfenster und zielt auf Arbeitsabläufe wie Videobearbeitung, Musikvideoproduktion und Echtzeitkonversation ab. Laut Gigazine übertrifft das Modell seinen Vorgänger Qwen3.5-Omni-Plus im Durchschnitt in 29 Benchmarks um über 25 %. Alibaba behauptet, dass das neue Modell eine Audio- und Videoleistung erreicht, die der von Gemini 3.8 Flash nahekommt oder diese übertrifft, und gleichzeitig die API-Kosten für die Spracheingabe um über 98 % und die Sprach-/Videoeingabe um über 93 % im Vergleich zur Vorgängerversion senkt. Die Veröffentlichung umfasst Erweiterungen für Qwen-MM-Plugins und einen Open-Source-Harness namens Qwen-Live Harness, dessen GitHub-Seite zum Zeitpunkt der Berichterstattung jedoch nicht zugänglich war.

Alibaba hat Qwen3.8-Omni-Flash zu seiner Qwen-Serie hinzugefügt und bezeichnet es als natives omnimodales Modell der nächsten Generation. Das Modell ist für eine breite Palette von Arbeitsabläufen konzipiert, darunter Videobearbeitung, Musikvideoproduktion, Filmproduktion, audiovisuelle Zusammenfassung und Echtzeitkonversation. Es unterstützt ein Kontextfenster von 1 Million Token, was eine erhebliche Steigerung darstellt und die Verarbeitung langer Audio- und Videodateien ermöglicht.

Laut Gigazine liefert das Modell im Vergleich zu seinem Vorgänger Qwen3.5-Omni-Plus bessere Ergebnisse. Bei 29 Benchmarks soll die durchschnittliche Punktzahl um mehr als 25 % höher liegen. Spezifische Verbesserungen sind bei Kernfunktionen wie dem Verstehen langer Audioinhalte, der Audio-/Video-Inferenz, der Untertitelung und der Erkennung mehrerer Sprecher zu verzeichnen. Beispielsweise erreichte es eine Punktzahl von 82,7 in LongAudioSpan und 89,7 in AliMeeting, einem für die Transkription von Mehrkanal-Konferenzaudio auf Chinesisch für mehrere Personen.

Alibaba behauptet, dass Qwen3.8-Omni-Flash Daten-, Kontext- und Agentenumgebungen skaliert, um eine Audio- und Videoleistung zu erreichen, die der von Gemini 3.8 Flash nahe kommt, wobei die Gesamt-Audioleistung diese sogar übertrifft. Das Unternehmen hebt erhebliche Kostensenkungen hervor und gibt an, dass die API-Kosten pro Stunde für die Spracheingabe um über 98 % und für die Sprach- und Videoeingabe um über 93 % niedriger sind als beim Vorgängermodell. Diese Kostenansprüche sind von zentraler Bedeutung für das Wertversprechen des Modells für Unternehmensbenutzer.

Um die Funktionen des Modells zu unterstützen, hat Alibaba die Qwen-MM-Plugins erweitert, um On-Demand-Wahrnehmungs-, Tool-Nutzungs- und Workflow-Ausführungsfunktionen für lange Audio- und Videodateien hinzuzufügen. Das Unternehmen kündigte außerdem die Open-Sourcing von Qwen-Live Harness an, einem umfassenden Harness, der auf der Qwen3.8-Omni-Flash-Realtime-API basiert. Gigazine stellt jedoch fest, dass zum Zeitpunkt des Verfassens dieses Artikels die Seite Qwen-Live Harness GitHub nicht zugänglich war und einen 404-Fehler zurückgab, was auf mögliche Verzögerungen oder Probleme bei der öffentlichen Veröffentlichung dieser Komponente hinweist.

Quellenangaben: gigazine.net ↗

Warum es wichtig ist

Diese Version ist von Bedeutung, da sie sich mit den hohen Kosten und der Komplexität der Verarbeitung langer Audio- und Videodaten in KI-Agenten befasst. Durch den Anspruch, nahezu grenzenlose Leistung zu einem Bruchteil der Kosten früherer Modelle zu erzielen, positioniert Alibaba Qwen3.8-Omni-Flash als praktisches Tool für Unternehmensanwendungen, die multimodales Denken in Echtzeit erfordern. Die Verlagerung von der Behandlung von Audio und Video als einfache Wahrnehmungseingaben hin zu Kernmedien für die Argumentation von Agenten könnte die Integration von KI in reale Produktivitätsszenarien, wie etwa automatisierte Medienproduktion und komplexe Konversationsagenten, beschleunigen. Allerdings basieren die spezifischen -Vergleiche mit Gemini 3.8 Flash auf den Behauptungen von Alibaba und wurden nicht von unabhängigen Gutachtern verifiziert.

Die Veröffentlichung von Qwen3.8-Omni-Flash ist für die KI-Branche von Bedeutung, da sie auf einen bestimmten Schwachpunkt abzielt: die hohen Kosten und die technische Komplexität der Verarbeitung langer multimodaler Daten. Durch den Anspruch, nahezu bahnbrechende Leistung zu drastisch reduzierten Kosten zu erzielen, stellt Alibaba den Status Quo der multimodalen KI-Preisgestaltung und -Zugänglichkeit in Frage. Dies könnte zu einer breiteren Einführung von KI-Agenten in Branchen führen, die stark auf Audio- und Videodaten angewiesen sind, wie etwa Medienproduktion, Kundenservice und Echtzeitübersetzung.

Die Fähigkeit des Modells, 1 Million Kontext-Tokens zu verarbeiten, ist ein großer technischer Fortschritt, da es die Verarbeitung viel längerer Audio- und Videodateien ohne Segmentierung ermöglicht. Dies ist von entscheidender Bedeutung für Anwendungen wie die Filmproduktion oder die Transkription längerer Besprechungen, bei denen die Kontinuität des Kontexts von entscheidender Bedeutung ist. Die Verbesserung der Erkennung mehrerer Sprecher und des Verständnisses langer Audioaufnahmen lässt darauf schließen, dass das Modell besser für komplexe, reale Szenarien geeignet ist als frühere Iterationen.

Die Behauptungen, Gemini 3.8 Flash zu übertreffen oder zu erreichen, basieren jedoch auf Alibabas internen Benchmarks und wurden nicht unabhängig überprüft. Dies ist ein häufiges Problem in der KI-Branche, in der sich Unternehmen häufig auf selbst gemeldete Kennzahlen verlassen. Unabhängige Bewertungen werden erforderlich sein, um die tatsächliche Leistung und Kosteneffizienz des Modells zu bestätigen. Bis dahin sollten Unternehmen die Behauptungen mit Vorsicht angehen und eigene Tests durchführen, bevor sie erhebliche Investitionen tätigen.

Das Open-Sourcing von Qwen-Live Harness ist ein positiver Schritt für die Entwicklergemeinschaft, da es ein Framework für die Erstellung von Anwendungen auf der Grundlage des Modells bietet. Allerdings ist die Unzugänglichkeit der Seite GitHub zum Zeitpunkt der Berichterstattung ein Warnsignal, das die Einführung verzögern könnte. Entwickler müssen warten, bis der Kabelbaum vollständig verfügbar und stabil ist, bevor sie mit der Entwicklung produktionsbereiter Anwendungen beginnen können.

Interactive Mechanism

Interaktiver Mechanismus: Wie es tatsächlich funktioniert

Entdecken Sie interaktiv die zugrunde liegende Technologie, die dieser Entwicklung zugrunde liegt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiver Konzeptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Was Sie als nächstes sehen sollten

Entwickler sollten die Verfügbarkeit und Stabilität des Qwen-Live Harness überwachen, da die Quelle feststellt, dass auf der Seite GitHub ein 404-Fehler zurückgegeben wurde. Darüber hinaus werden unabhängige Benchmarks, die Qwen3.8-Omni-Flash mit anderen Spitzenmodellen wie Gemini 3.8 Flash vergleichen, von entscheidender Bedeutung sein, um Alibabas Leistungsansprüche zu validieren. Die praktischen Auswirkungen auf die API-Preisgestaltung für multimodale Aufgaben werden auch ein Schlüsselfaktor für Unternehmen sein, die über die Einführung nachdenken.

Die Verfügbarkeit und Stabilität des Qwen-Live Harness wird ein Schlüsselfaktor für die Einführung des Modells sein. Wenn die GitHub-Seite weiterhin nicht zugänglich ist oder der Harness erhebliche Fehler aufweist, könnte dies Entwickler daran hindern, Anwendungen auf Qwen3.8-Omni-Flash zu erstellen. Die Überwachung des GitHub-Repositorys und aller Updates von Alibaba ist von entscheidender Bedeutung.

Unabhängige Benchmarks, die Qwen3.8-Omni-Flash mit anderen Spitzenmodellen wie Gemini 3.8 Flash und GPT-4o vergleichen, werden für die Validierung der Leistungsansprüche von Alibaba von entscheidender Bedeutung sein. Bewertungen durch Dritte werden einen objektiveren Überblick über die Fähigkeiten des Modells liefern und Unternehmen dabei helfen, fundierte Entscheidungen über die Einführung zu treffen.

Auch die praktischen Auswirkungen auf die API-Preisgestaltung für multimodale Aufgaben werden ein Schlüsselfaktor sein. Sollten die von Alibaba behaupteten Kostensenkungen realisiert werden, könnte dies zu einer erheblichen Marktverschiebung führen und multimodale KI für kleinere Unternehmen und Entwickler zugänglicher machen. Es wird wichtig sein, die tatsächlichen API-Kosten zu überwachen und sie mit denen der Konkurrenz zu vergleichen.

Die Leistung des Modells in realen Szenarien wie Videobearbeitung und Echtzeitgesprächen wird ein wichtiger Indikator für seinen praktischen Nutzen sein. Benutzerfeedback und Fallstudien von Erstanwendern werden wertvolle Einblicke in die Stärken und Grenzen des Modells liefern.

Verwandte Leitfäden und Quizze

KI-Modelle erklärtKI-AgentenWas ist KI?Testen Sie, was Sie wissen – probieren Sie ein kostenloses KI-Quiz ausSuchen Sie in unserem Glossar nach einem KI-BegriffFolgen Sie dem AI-Modell-Release-Tracker
Fanden Sie das nützlich?