Вернуться к новостям
ПродуктAI Understanding брифинг

Alibaba выпускает Qwen3.8-Omni-Flash для мультимодальных агентских задач

Alibaba выпустила Qwen3.8-Omni-Flash, собственную омнимодальную модель, поддерживающую 1 миллион токенов контекста, которая, по ее утверждению, обеспечивает производительность аудио и видео, сравнимую с Gemini 3.8 Flash, при значительно меньших затратах на API.

5 min readRead the linked source
Source-provided image accompanying Alibaba releases Qwen3.8-Omni-Flash for multimodal agent tasks
Ссылка на источникИсточник записан
Издатель
gigazine.net
Ссылка на источник
gigazine.nethttps://gigazine.net/gsc_news/en/20260918-qwen-3-8-omni-flash/
Тип источника
Связанный источник — статус первоисточника не установлен.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

API (интерфейс прикладного программирования)
Структурированный способ отправки одной программной системой запросов и получения ответов от другой системы.
Контекстное окно
Максимальное количество входных токенов, которые языковая модель может обработать одновременно.
Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

Alibaba выпустила Qwen3.8-Omni-Flash, новую модель в серии Qwen, предназначенную для омнимодальной обработки. Модель поддерживает контекстное окно на 1 миллион токенов и предназначена для таких рабочих процессов, как редактирование видео, создание музыкальных видео и общение в реальном времени. По данным Gigazine, модель превосходит свою предшественницу Qwen3.5-Omni-Plus в среднем более чем на 25% по 29 тестам. Alibaba утверждает, что новая модель обеспечивает производительность аудио и видео, близкую или превосходящую Gemini 3.8 Flash, при этом сокращая затраты на API для голосового ввода более чем на 98% и голосового/видео ввода более чем на 93% по сравнению с предыдущей версией. Релиз включает в себя расширения для Qwen-MM-Plugins и пакет с открытым исходным кодом под названием Qwen-Live Harness, хотя страница GitHub последнего на момент написания отчета была недоступна.

Alibaba добавила Qwen3.8-Omni-Flash в свою серию Qwen, назвав ее собственной омнимодальной моделью следующего поколения. Модель предназначена для выполнения широкого спектра рабочих процессов, включая редактирование видео, производство музыкальных видеоклипов, производство фильмов, аудиовизуальное обобщение и общение в реальном времени. Он поддерживает контекстное окно размером в 1 миллион токенов, что является существенным увеличением, позволяющим обрабатывать длинные аудио- и видеофайлы.

По данным Gigazine, модель обеспечивает превосходные результаты по сравнению со своей предшественницей Qwen3.5-Omni-Plus. По 29 критериям средний балл, как сообщается, выше более чем на 25%. Конкретные улучшения отмечены в основных функциях, таких как понимание длинного звука, вывод аудио/видео, субтитры и распознавание нескольких говорящих. Например, он получил оценку 82,7 в LongAudioSpan и 89,7 в AliMeeting, тесте для расшифровки звука многоканальных конференций с участием нескольких человек на китайском языке.

Alibaba утверждает, что Qwen3.8-Omni-Flash масштабирует данные, контекст и среду агентов для достижения производительности аудио и видео, близкой к производительности Gemini 3.8 Flash, при этом общая производительность звука превосходит ее. Компания подчеркивает значительное снижение затрат, заявляя, что почасовая стоимость API для голосового ввода более чем на 98% ниже, а для голосового и видеоввода — более чем на 93% ниже, чем у предыдущей модели. Эти заявления о затратах играют центральную роль в ценностном предложении модели для корпоративных пользователей.

Для поддержки возможностей модели Alibaba расширила плагины Qwen-MM-Plugins, добавив возможности восприятия по требованию, использования инструментов и выполнения рабочих процессов для длинных аудио и видео. Компания также объявила об открытии исходного кода Qwen-Live Harness, комплексного программного обеспечения, разработанного на основе API Qwen3.8-Omni-Flash-Realtime. Однако Gigazine отмечает, что на момент написания страницы страница Qwen-Live Harness GitHub не была доступна и возвращала ошибку 404, указывающую на потенциальные задержки или проблемы с публичным выпуском этого компонента.

Подробности об источнике: gigazine.net ↗

Почему это важно

Этот выпуск важен, поскольку он устраняет высокую стоимость и сложность обработки длинных аудио- и видеоданных в агентах ИИ. Заявляя о почти граничной производительности за небольшую часть стоимости предыдущих моделей, Alibaba позиционирует Qwen3.8-Omni-Flash как практический инструмент для корпоративных приложений, требующих мультимодального анализа в реальном времени. Переход от рассмотрения аудио и видео как простых входных данных восприятия к основным средствам массовой информации для рассуждений агентов может ускорить интеграцию ИИ в реальные сценарии повышения производительности, такие как автоматизированное производство мультимедиа и сложные диалоговые агенты. Однако конкретные сравнения тестов с Gemini 3.8 Flash основаны на заявлениях Alibaba и не прошли независимую проверку сторонними оценщиками.

Выпуск Qwen3.8-Omni-Flash имеет большое значение для индустрии искусственного интеллекта, поскольку он нацелен на конкретную проблему: высокую стоимость и техническую сложность обработки мультимодальных данных длинной формы. Заявляя о почти граничной производительности при значительно сниженных затратах, Alibaba бросает вызов статус-кво ценообразования и доступности мультимодального ИИ. Это может привести к более широкому внедрению агентов искусственного интеллекта в отраслях, которые в значительной степени полагаются на аудио- и видеоданные, таких как производство мультимедиа, обслуживание клиентов и перевод в реальном времени.

Способность модели обрабатывать 1 миллион токенов контекста является крупным техническим достижением, поскольку она позволяет обрабатывать гораздо более длинные аудио- и видеофайлы без сегментации. Это крайне важно для таких приложений, как производство фильмов или расшифровка длинных встреч, где важна непрерывность контекста. Улучшение распознавания нескольких говорящих и понимание длинного звука позволяют предположить, что модель лучше подходит для сложных реальных сценариев, чем предыдущие версии.

Однако заявления о превосходстве или совпадении Gemini 3.8 Flash основаны на внутренних тестах Alibaba и не прошли независимой проверки. Это распространенная проблема в индустрии искусственного интеллекта, где компании часто полагаются на показатели, сообщаемые самостоятельно. Для подтверждения истинной эффективности и экономической эффективности модели потребуются независимые оценки. До тех пор предприятиям следует относиться к заявлениям с осторожностью и проводить собственные испытания, прежде чем делать значительные инвестиции.

Открытие исходного кода Qwen-Live Harness является положительным шагом для сообщества разработчиков, поскольку оно обеспечивает основу для создания приложений на основе модели. Однако недоступность страницы GitHub на момент составления отчета является тревожным сигналом, который может задержать внедрение. Разработчикам придется дождаться полной доступности и стабильности системы, прежде чем они смогут приступить к созданию готовых к использованию приложений.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Разработчикам следует следить за доступностью и стабильностью Qwen-Live Harness, поскольку источник отмечает, что его страница GitHub вернула ошибку 404. Кроме того, независимые тесты, сравнивающие Qwen3.8-Omni-Flash с другими передовыми моделями, такими как Gemini 3.8 Flash, будут иметь решающее значение для подтверждения заявлений Alibaba о производительности. Практическое влияние на ценообразование API для мультимодальных задач также будет ключевым фактором для предприятий, рассматривающих возможность внедрения.

Доступность и стабильность Qwen-Live Harness станет ключевым фактором при принятии модели. Если страница GitHub остается недоступной или если в программе есть серьезные ошибки, это может помешать разработчикам создавать приложения на основе Qwen3.8-Omni-Flash. Мониторинг репозитория GitHub и любых обновлений от Alibaba будет иметь важное значение.

Независимые тесты, сравнивающие Qwen3.8-Omni-Flash с другими передовыми моделями, такими как Gemini 3.8 Flash и GPT-4o, будут иметь решающее значение для подтверждения заявлений Alibaba о производительности. Сторонние оценки обеспечат более объективное представление о возможностях модели и помогут предприятиям принять обоснованные решения о ее внедрении.

Практическое влияние на ценообразование API для мультимодальных задач также будет ключевым фактором. Если снижение затрат, о котором заявляет Alibaba, будет реализовано, это может привести к значительным изменениям на рынке, сделав мультимодальный ИИ более доступным для небольших компаний и разработчиков. Будет важно отслеживать фактические затраты на API и сравнивать их с конкурентами.

Производительность модели в реальных сценариях, таких как редактирование видео и общение в реальном времени, станет ключевым показателем ее практической полезности. Отзывы пользователей и тематические исследования первых пользователей дадут ценную информацию о сильных и слабых сторонах модели.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаИИ-агентыЧто такое ИИ?Проверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?