GUIDE DES ENTREPRISES

Alibaba Qwen

Qwen (Tongyi Qianwen) est la famille de grands modèles linguistiques d'Alibaba, et elle est devenue l'une des familles de modèles d'IA à poids ouvert les plus téléchargées au monde.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because it gives developers everywhere free, commercially usable models that rival closed systems from OpenAI and Google.

Plongée profonde

Qwen, abréviation de « Tongyi Qianwen » (en gros « la vérité parmi mille questions »), est développé par la DAMO Academy d'Alibaba Cloud. Lancée pour la première fois en 2023, la gamme s'est rapidement élargie pour inclure des modèles de texte, des modèles de langage de vision (Qwen-VL), des modèles audio, des modèles de codage (Qwen-Coder) et des spécialistes en mathématiques. Alibaba publie de nombreux modèles Qwen sous licences ouvertes permissives sur Hugging Face et ModelScope, ce qui fait de Qwen2 et Qwen2.5 l'une des bases de modèles les plus perfectionnées et téléchargées au monde. Les modèles sont disponibles dans de nombreuses tailles, depuis de minuscules versions de 0,5 milliard de paramètres fonctionnant sur un ordinateur portable jusqu'à des variantes massives de mélange d'experts. De solides capacités multilingues, notamment en chinois et en anglais, ainsi que des scores de référence compétitifs, ont fait de Qwen un choix par défaut pour les chercheurs et les startups qui créent leurs propres assistants.

Aperçu technique

Qwen utilise une architecture de décodeur Transformer avec des améliorations telles que les intégrations positionnelles RoPE, les activations SwiGLU, RMSNorm et l'attention aux requêtes groupées pour une inférence plus rapide. Les versions plus grandes adoptent une conception de mélange d'experts (MoE), dans laquelle un routeur n'active que quelques sous-réseaux experts par jeton, offrant ainsi une capacité totale énorme tout en maintenant le calcul par jeton à un faible niveau. Les variantes de « Chat » adaptées aux instructions sont alignées à l'aide d'un réglage fin supervisé et d'un apprentissage par renforcement à partir de la rétroaction humaine (RLHF).

Impact stratégique

Stratégie du fournisseur

Les feuilles de route des fournisseurs influencent les fonctionnalités que votre équipe peut ensuite créer.

Coût et budget

Les conditions commerciales et les options de déploiement affectent les coûts et les risques à long terme.

Risques et sécurité

Les incitations des entreprises façonnent les défauts des produits, la posture de sécurité et l’ouverture.

L'avenir d'Alibaba Qwen

Alibaba investit massivement dans Qwen en tant que produit phare de son activité cloud, se précipitant pour correspondre aux modèles de raisonnement les plus avancés. Attendez-vous à des fenêtres contextuelles plus longues, à des capacités d'agent et d'utilisation d'outils plus fortes, à des modèles MoE plus efficaces et à une intégration multimodale plus étroite entre le texte, l'image, l'audio et la vidéo. En tant que famille leader de pondération ouverte, Qwen continuera probablement à ancrer un écosystème mondial de produits dérivés affinés, et ses progrès sont un indicateur clé de la compétitivité des laboratoires d’IA chinois par rapport aux laboratoires pionniers américains.

Mise en œuvre dans le monde réel

Une startup peaufine un modèle ouvert Qwen2.5 pour créer un chatbot de support client privé sans payer de frais d'API par jeton.

Les développeurs utilisent Qwen-Coder pour compléter et expliquer automatiquement le code dans leur IDE pour les projets logiciels.

Les chercheurs exécutent localement un petit modèle Qwen de 0,5 ou 1,5 milliard sur un ordinateur portable pour prototyper des assistants hors ligne préservant la confidentialité.

Une équipe de commerce électronique utilise Qwen-VL pour lire les photos de produits et générer automatiquement des descriptions et des balises d'annonces.

Risques et garde-fous

Les annonces de lancement peuvent dépasser la stabilité des flux de production réels.

La tarification des API ou les changements de politique peuvent briser les hypothèses du jour au lendemain.

La dépendance à un seul fournisseur augmente les coûts de verrouillage et de migration.

Feuille de route de mise en œuvre

1

Évaluez les fournisseurs à l’aide de vos propres tâches et ensembles de données.

2

Vérifiez les conditions de confidentialité, de sécurité et juridiques avant l’intégration.

3

Maintenez un plan de secours entre les modèles ou les fournisseurs.

4

Surveillez les notes de version afin que les modifications de la feuille de route ne surprennent pas les équipes.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Alibaba Qwen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Laboratoire Tongyi et recherche Qwen

Questions fréquemment posées

What is Alibaba Qwen?

Qwen (Tongyi Qianwen) est la famille de grands modèles linguistiques d'Alibaba, et elle est devenue l'une des familles de modèles d'IA à poids ouvert les plus téléchargées au monde. C'est important car cela offre aux développeurs du monde entier des modèles gratuits et commercialement utilisables qui rivalisent avec les systèmes fermés de OpenAI et Google.

Quelle entreprise développe la famille de modèles d’IA Qwen ?

Qwen, ou Tongyi Qianwen, est développé par Alibaba Cloud et son groupe de recherche DAMO Academy.

Quelle est la principale raison pour laquelle Qwen est devenu si largement utilisé par les développeurs ?

Alibaba a publié de nombreux modèles Qwen sous licences ouvertes permissives, ce qui en fait l'une des bases de modèles les plus téléchargées et les plus perfectionnées au monde.

À quoi sert la conception Mixture-of-Experts (MoE) dans les grands modèles Qwen ?

Le MoE utilise un routeur pour activer uniquement un petit sous-ensemble de sous-réseaux experts pour chaque jeton, offrant ainsi une grande capacité totale à un coût de calcul par jeton inférieur.

Quelle variante spécialisée de Qwen est conçue pour les tâches de programmation ?

Qwen-Coder est la variante spécialement conçue pour la génération, la complétion et l'explication de code.

Qwen-VL fait référence à un modèle capable de traiter quelle combinaison ?

Qwen-VL est un modèle de langage de vision capable d'interpréter des images à côté du texte, utile pour des tâches telles que la description de photos de produits.