Kembali ke Berita
produkAI Understanding taklimat

Alibaba mengeluarkan Qwen3.8-Omni-Flash untuk tugas ejen pelbagai mod

Alibaba telah mengeluarkan Qwen3.8-Omni-Flash, model omnimodal asli yang menyokong 1 juta token konteks, yang didakwa mencapai prestasi audio dan video yang setanding dengan Gemini 3.8 Flash pada kos API yang jauh lebih rendah.

5 min readRead the linked source
Source-provided image accompanying Alibaba releases Qwen3.8-Omni-Flash for multimodal agent tasks
Rujukan sumberSumber direkodkan
Penerbit
gigazine.net
Pautan sumber
gigazine.nethttps://gigazine.net/gsc_news/en/20260918-qwen-3-8-omni-flash/
Jenis sumber
Sumber terpaut — status sumber primer belum ditetapkan.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Tetingkap Konteks
Jumlah maksimum token input model bahasa boleh diproses sekaligus.
Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Alibaba mengeluarkan Qwen3.8-Omni-Flash, model baharu dalam siri Qwen yang direka untuk pemprosesan omnimodal. Model ini menyokong tetingkap konteks token 1 juta dan menyasarkan aliran kerja seperti penyuntingan video, pengeluaran video muzik dan perbualan masa nyata. Menurut Gigazine, model itu mengatasi prestasi pendahulunya, Qwen3.5-Omni-Plus, sebanyak lebih 25% secara purata merentas 29 penanda aras. Alibaba mendakwa model baharu itu mencapai prestasi audio dan video hampir atau melebihi Gemini 3.8 Flash, sambil mengurangkan kos API untuk input suara sebanyak lebih 98% dan input suara/video sebanyak lebih 93% berbanding versi sebelumnya. Keluaran ini termasuk sambungan kepada Qwen-MM-Plugins dan abah-abah sumber terbuka yang dipanggil Qwen-Live Harness, walaupun halaman GitHub yang terakhir tidak boleh diakses pada masa pelaporan.

Alibaba telah menambah Qwen3.8-Omni-Flash pada siri Qwennya, menggambarkannya sebagai model omnimodal asli generasi akan datang. Model ini direka bentuk untuk mengendalikan pelbagai aliran kerja, termasuk penyuntingan video, pengeluaran video muzik, pengeluaran filem, ringkasan audiovisual dan perbualan masa nyata. Ia menyokong tetingkap konteks sebanyak 1 juta token, yang merupakan peningkatan yang ketara yang membolehkan pemprosesan fail audio dan video dalam bentuk panjang.

Menurut Gigazine, model itu memberikan hasil yang lebih baik berbanding pendahulunya, Qwen3.5-Omni-Plus. Merentasi 29 penanda aras, skor purata dilaporkan lebih daripada 25% lebih tinggi. Penambahbaikan khusus dinyatakan dalam fungsi teras seperti memahami audio panjang, inferens audio/video, kapsyen dan pengecaman berbilang pembesar suara. Sebagai contoh, ia mencapai skor 82.7 dalam LongAudioSpan dan 89.7 dalam AliMeeting, penanda aras untuk menyalin audio persidangan berbilang orang, berbilang saluran dalam bahasa Cina.

Alibaba mendakwa bahawa Qwen3.8-Omni-Flash menskalakan data, konteks dan persekitaran ejen untuk mencapai prestasi audio dan video hampir dengan Gemini 3.8 Flash, dengan prestasi audio keseluruhan mengatasinya. Syarikat itu menyerlahkan pengurangan kos yang ketara, dengan menyatakan bahawa kos API sejam untuk input suara adalah lebih 98% lebih rendah, dan untuk input suara dan video, ia lebih 93% lebih rendah daripada model sebelumnya. Tuntutan kos ini adalah penting kepada cadangan nilai model untuk pengguna perusahaan.

Untuk menyokong keupayaan model, Alibaba telah memperluaskan Qwen-MM-Plugins untuk menambah persepsi atas permintaan, penggunaan alat dan keupayaan pelaksanaan aliran kerja untuk audio dan video yang panjang. Syarikat itu juga mengumumkan sumber terbuka Qwen-Live Harness, abah-abah komprehensif yang direka berdasarkan API Qwen3.8-Omni-Flash-Realtime. Walau bagaimanapun, Gigazine menyatakan bahawa pada masa penulisan, halaman Qwen-Live Harness GitHub tidak boleh diakses dan mengembalikan ralat 404, yang menunjukkan kemungkinan kelewatan atau masalah dengan keluaran awam komponen ini.

Butiran sumber: gigazine.net ↗

Mengapa ia penting

Keluaran ini penting kerana ia menangani kos yang tinggi dan kerumitan pemprosesan data audio dan video bentuk panjang dalam ejen AI. Dengan menuntut prestasi berhampiran sempadan pada sebahagian kecil daripada kos model sebelumnya, Alibaba meletakkan Qwen3.8-Omni-Flash sebagai alat praktikal untuk aplikasi perusahaan yang memerlukan penaakulan multimodal masa nyata. Peralihan daripada menganggap audio dan video sebagai input persepsi mudah kepada media teras untuk penaakulan ejen boleh mempercepatkan penyepaduan AI ke dalam senario produktiviti dunia sebenar, seperti pengeluaran media automatik dan ejen perbualan yang kompleks. Walau bagaimanapun, perbandingan penanda aras khusus kepada Gemini 3.8 Flash adalah berdasarkan dakwaan Alibaba dan belum disahkan secara bebas oleh penilai pihak ketiga.

Pengeluaran Qwen3.8-Omni-Flash adalah penting untuk industri AI kerana ia menyasarkan titik kesakitan tertentu: kos tinggi dan kerumitan teknikal memproses data pelbagai mod bentuk panjang. Dengan menuntut prestasi berhampiran sempadan pada kos yang dikurangkan secara drastik, Alibaba mencabar status quo penentuan harga dan kebolehcapaian AI pelbagai mod. Ini boleh membawa kepada penggunaan ejen AI yang lebih luas dalam industri yang banyak bergantung pada data audio dan video, seperti pengeluaran media, perkhidmatan pelanggan dan terjemahan masa nyata.

Keupayaan model untuk mengendalikan 1 juta token konteks adalah kemajuan teknikal utama, kerana ia membolehkan pemprosesan fail audio dan video yang lebih lama tanpa pembahagian. Ini penting untuk aplikasi seperti penerbitan filem atau transkripsi mesyuarat dalam bentuk panjang, di mana kesinambungan konteks adalah penting. Peningkatan dalam pengecaman berbilang pembesar suara dan pemahaman audio yang panjang menunjukkan bahawa model itu lebih sesuai untuk senario dunia sebenar yang kompleks berbanding lelaran sebelumnya.

Walau bagaimanapun, dakwaan untuk mengatasi prestasi atau padanan Gemini 3.8 Flash adalah berdasarkan penanda aras dalaman Alibaba dan belum disahkan secara bebas. Ini adalah isu biasa dalam industri AI, di mana syarikat sering bergantung pada metrik yang dilaporkan sendiri. Penilaian bebas akan diperlukan untuk mengesahkan prestasi sebenar dan keberkesanan kos model. Sehingga itu, perusahaan harus mendekati tuntutan dengan berhati-hati dan menjalankan ujian mereka sendiri sebelum membuat pelaburan yang besar.

Sumber terbuka Qwen-Live Harness ialah langkah positif untuk komuniti pembangun, kerana ia menyediakan rangka kerja untuk membina aplikasi di atas model. Walau bagaimanapun, ketidakbolehaksesan halaman GitHub pada masa pelaporan adalah tanda merah yang boleh melambatkan penggunaan. Pembangun perlu menunggu abah-abah tersedia sepenuhnya dan stabil sebelum mereka boleh mula membina aplikasi sedia pengeluaran.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Pembangun harus memantau ketersediaan dan kestabilan Qwen-Live Harness, kerana sumber menyatakan halaman GitHubnya mengembalikan ralat 404. Selain itu, penanda aras bebas yang membandingkan Qwen3.8-Omni-Flash dengan model sempadan lain seperti Gemini 3.8 Flash akan menjadi penting untuk mengesahkan tuntutan prestasi Alibaba. Kesan praktikal ke atas penetapan harga API untuk tugas multimodal juga akan menjadi faktor utama bagi perusahaan yang mempertimbangkan penerimaan.

Ketersediaan dan kestabilan Qwen-Live Harness akan menjadi faktor utama dalam penggunaan model. Jika halaman GitHub kekal tidak boleh diakses atau jika abah-abah mempunyai pepijat yang ketara, ia boleh menghalang pembangun daripada membina aplikasi di atas Qwen3.8-Omni-Flash. Memantau repositori GitHub dan sebarang kemas kini daripada Alibaba adalah penting.

Penanda aras bebas yang membandingkan Qwen3.8-Omni-Flash dengan model sempadan lain, seperti Gemini 3.8 Flash dan GPT-4o, akan menjadi penting untuk mengesahkan tuntutan prestasi Alibaba. Penilaian pihak ketiga akan memberikan pandangan yang lebih objektif tentang keupayaan model dan membantu perusahaan membuat keputusan termaklum tentang penerimaan.

Kesan praktikal pada penetapan harga API untuk tugasan pelbagai mod juga akan menjadi faktor utama. Sekiranya pengurangan kos yang dituntut oleh Alibaba direalisasikan, ia boleh membawa kepada perubahan ketara dalam pasaran, menjadikan AI multimodal lebih mudah diakses oleh syarikat dan pemaju yang lebih kecil. Memantau kos API sebenar dan membandingkannya dengan pesaing adalah penting.

Prestasi model dalam senario dunia sebenar, seperti penyuntingan video dan perbualan masa nyata, akan menjadi penunjuk utama utiliti praktikalnya. Maklum balas pengguna dan kajian kes daripada pengguna awal akan memberikan pandangan berharga tentang kekuatan dan batasan model.

Panduan & kuiz berkaitan

Model AI DiterangkanEjen AIApakah AI?Uji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?