返回新闻
产品展示AI Understanding 简报

阿里巴巴发布Qwen3.8-Omni-Flash,用于多模式代理任务

阿里巴巴发布了 Qwen3.8-Omni-Flash,这是一种支持 100 万个上下文令牌的原生全模态模型,据称该模型以显着降低的 API 成本实现了与 Gemini 3.8 Flash 相当的音频和视频性能。

5 min readRead the linked source
Source-provided image accompanying Alibaba releases Qwen3.8-Omni-Flash for multimodal agent tasks
来源参考来源记录
出版商
gigazine.net
来源链接
gigazine.nethttps://gigazine.net/gsc_news/en/20260918-qwen-3-8-omni-flash/
来源类型
链接来源——主要来源状态尚未确定。
背景60 秒内了解这一点

从这里开始

关键术语

API(应用程序编程接口)
一种软件系统向另一个系统发送请求并接收响应的结构化方式。
上下文窗口
语言模型一次可以处理的输入标记的最大数量。
基准测试
用于测量和比较模型性能的标准化测试或数据集。
测试一下自己AI 模型解释测验

发生了什么

阿里巴巴发布了Qwen3.8-Omni-Flash,这是其Qwen系列专为全模态处理而设计的新型号。该模型支持 100 万个令牌上下文窗口,并针对视频编辑、音乐视频制作和实时对话等工作流程。据 Gigazine 称,该模型在 29 个基准测试中的性能比其前身 Qwen3.5-Omni-Plus 平均高出 25% 以上。阿里巴巴称,新模型的音视频性能接近或超越Gemini 3.8 Flash,同时与之前的版本相比,语音输入的API成本降低了98%以上,音视频输入的API成本降低了93%以上。该版本包括 Qwen-MM-Plugins 的扩展和一个名为 Qwen-Live Harness 的开源工具,尽管后者的 GitHub 页面在报告时无法访问。

阿里巴巴已将Qwen3.8-Omni-Flash添加到其Qwen系列中,将其描述为下一代原生全模态模型。该模型旨在处理广泛的工作流程,包括视频编辑、音乐视频制作、电影制作、视听摘要和实时对话。它支持 100 万个令牌的上下文窗口,这是一个实质性的增长,可以处理长格式的音频和视频文件。

据 Gigazine 称,与上一代产品 Qwen3.5-Omni-Plus 相比,该模型提供了更出色的结果。据报道,在 29 个基准测试中,平均得分高出了 25% 以上。具体改进包括理解长音频、音频/视频推理、字幕和多说话人识别等核心功能。例如,它在多人多通道中文会议音频转录基准测试中,LongAudioSpan 获得了 82.7 分,在 AliMeeting 中获得了 89.7 分。

阿里巴巴声称,Qwen3.8-Omni-Flash扩展了数据、上下文和代理环境,实现了接近Gemini 3.8 Flash的音频和视频性能,整体音频性能超越了Gemini 3.8 Flash。该公司强调了成本的显着降低,表示语音输入的每小时 API 成本比以前的型号降低了 98% 以上,而语音和视频输入的每小时 API 成本则降低了 93% 以上。这些成本主张是该模型对企业用户的价值主张的核心。

为了支持该模型的能力,阿里巴巴扩展了Qwen-MM-Plugins,增加了长音视频的按需感知、工具使用和工作流程执行能力。该公司还宣布开源Qwen-Live Harness,这是一款基于Qwen3.8-Omni-Flash-Realtime API设计的综合线束。然而,Gigazine 指出,在撰写本文时,Qwen-Live Harness GitHub 页面无法访问并返回 404 错误,表明该组件的公开发布存在潜在的延迟或问题。

来源详情: gigazine.net ↗

为什么这很重要

此版本意义重大,因为它解决了人工智能代理中处理长格式音频和视频数据的高成本和复杂性问题。阿里巴巴宣称,其性能接近前沿,而成本仅为之前型号的一小部分,因此阿里巴巴将 Qwen3.8-Omni-Flash 定位为需要实时多模态推理的企业应用程序的实用工具。从将音频和视频视为简单的感知输入到用于代理推理的核心媒体的转变可以加速人工智能与现实世界生产力场景的集成,例如自动化媒体制作和复杂的对话代理。不过,与Gemini 3.8 Flash的具体基准比较基于阿里巴巴的说法,尚未经过第三方评估机构的独立验证。

Qwen3.8-Omni-Flash的发布对于AI行业具有重要意义,因为它针对的是一个特定的痛点:处理长格式多模态数据的高成本和技术复杂性。通过声称以大幅降低的成本实现近乎前沿的性能,阿里巴巴正在挑战多模式人工智能定价和可访问性的现状。这可能会导致人工智能代理在严重依赖音频和视频数据的行业中得到更广泛的采用,例如媒体制作、客户服务和实时翻译。

该模型能够处理 100 万个上下文标记,这是一项重大技术进步,因为它允许处理更长的音频和视频文件而无需分段。这对于电影制作或长格式会议转录等应用至关重要,在这些应用中上下文连续性至关重要。多说话者识别和长音频理解方面的改进表明,该模型比以前的迭代更适合复杂的现实场景。

然而,优于或匹配 Gemini 3.8 Flash 的说法是基于阿里巴巴的内部基准测试,尚未经过独立验证。这是人工智能行业的一个常见问题,该行业的公司经常依赖自我报告的指标。需要进行独立评估来确认模型的真实性能和成本效益。在此之前,企业应谨慎对待这些说法,并在进行重大投资之前进行自己的测试。

Qwen-Live Harness的开源对于开发者社区来说是积极的一步,因为它提供了在模型之上构建应用程序的框架。然而,在报告时 GitHub 页面无法访问是一个危险信号,可能会延迟采用。开发人员需要等待该工具完全可用且稳定,然后才能开始构建可投入生产的应用程序。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

接下来看什么

开发人员应监控 Qwen-Live Harness 的可用性和稳定性,因为消息来源指出其 GitHub 页面返回了 404 错误。此外,将 Qwen3.8-Omni-Flash 与 Gemini 3.8 Flash 等其他前沿模型进行比较的独立基准测试对于验证阿里巴巴的性能声明至关重要。对多模式任务 API 定价的实际影响也将是企业考虑采用的关键因素。

Qwen-Live Harness 的可用性和稳定性将是该模型采用的关键因素。如果 GitHub 页面仍然无法访问或者该工具存在重大错误,则可能会阻碍开发人员在 Qwen3.8-Omni-Flash 之上构建应用程序。监控 GitHub 存储库以及来自阿里巴巴的任何更新至关重要。

将 Qwen3.8-Omni-Flash 与其他前沿模型(例如 Gemini 3.8 Flash 和 GPT-4o)进行比较的独立基准测试对于验证阿里巴巴的性能声明至关重要。第三方评估将为模型的功能提供更客观的看法,并帮助企业做出明智的采用决策。

对多模式任务 API 定价的实际影响也将是一个关键因素。如果阿里巴巴声称的成本降低得以实现,可能会导致市场发生重大转变,使小公司和开发商更容易使用多模式人工智能。监控实际 API 成本并将其与竞争对手进行比较非常重要。

该模型在视频编辑和实时对话等现实场景中的表现将是其实用性的关键指标。用户反馈和早期采用者的案例研究将为了解该模型的优点和局限性提供有价值的见解。

相关指南和测验

人工智能模型解释人工智能代理什么是人工智能?测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?