Retour aux Actualités
ProduitBriefing AI Understanding

Qualcomm dévoile Hexagon NPU destiné à l'IA agentique permanente

Le Lec rapporte que le NPU Hexagon de nouvelle génération de Qualcomm ajoute un accélérateur d’éléments, 50 % de mémoire partagée en plus et une première prise en charge des modèles MoE allant jusqu’à 30 milliards de paramètres.

4 min readRead the linked source
Source-provided image accompanying Qualcomm unveils Hexagon NPU aimed at always-on agentic AI
Référence sourceSource enregistrée
Éditeur
thelec.net
Lien source
thelec.nethttps://www.thelec.net/news/articleView.html?idxno=13884
Type de source
Source liée : le statut de source principale n'a pas été établi.
ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

Mélange d'experts (MoE)
Une architecture avec des sous-réseaux spécialisés où seuls des experts sélectionnés s'exécutent par entrée.
Mémoire (mémoire de l'agent)
Contexte stocké qu'un agent IA utilise au fil des étapes ou des sessions pour améliorer la continuité.
Transformateur
Une architecture neuronale qui utilise l'attention pour modéliser les relations entre les séquences en parallèle.
Testez-vousQuiz sur les agents IA

Que s'est-il passé

Le Lec rapporte que Qualcomm a dévoilé le 10 septembre une unité de traitement neuronal Hexagon de nouvelle génération pour les charges de travail continues d'IA agentique sur les appareils mobiles. La conception rapportée ajoute un accélérateur d'éléments pour les charges de travail des transformateurs, augmente la mémoire partagée de 50 % et prend en charge des modèles mixtes d'experts avec jusqu'à 30 milliards de paramètres, avec environ 3 milliards actifs pour chaque jeton généré. Selon The Lec, le NPU prend en charge les formats de données FP16, INT2, INT4, INT8 et FP8. Qualcomm affirme que les performances de pré-remplissage de l'INT4 peuvent être jusqu'à 50 % plus rapides et que les réponses peuvent commencer en 1,5 seconde, bien que The Lec ne rapporte pas de tests indépendants sur ces chiffres. Le NPU est destiné à fonctionner avec le processeur Oryon et le GPU Adreno de Snapdragon pour les flux de travail en plusieurs étapes et le traitement de l'IA lié aux graphiques. Le rapport indique que Qualcomm fournira plus de détails lors du Snapdragon Summit aux États-Unis du 22 au 24 septembre. La source n'identifie pas de smartphone spécifique, de date de lancement, de disponibilité au détail, de prix ou de résultats de référence tiers confirmés.

Le Lec rapporte que Qualcomm a dévoilé son Hexagon NPU de nouvelle génération le 10 septembre, le positionnant comme un matériel mobile pour les systèmes d'IA qui interprètent le contexte, raisonnent entre les applications et effectuent des tâches pour les utilisateurs. Le matériel signalé ajoute un accélérateur d'éléments aux extensions scalaires, vectorielles et matricielles existantes, dans le but d'améliorer le calcul du modèle de transformateur tout en gérant la consommation d'énergie.

Le rapport indique que la capacité de la mémoire partagée est 50 % supérieure à celle de la conception précédente. Le raisonnement avancé par Qualcomm est que garder l'état du modèle, les activations et les données de tenseur intermédiaire plus proches du processeur peut réduire les transferts vers la DRAM externe, améliorant potentiellement la rétention du contexte et le changement de tâche. Le rapport ne fournit pas de comparaison indépendante avec une mise en œuvre antérieure d'Hexagone.

Le nouvel Hexagon prendrait en charge des modèles mixtes d'experts avec jusqu'à 30 milliards de paramètres, tout en activant environ 3 milliards de paramètres routés par jeton. Le Lec signale également la gestion et la mise en cache NAND flash-to-memory destinées à charger uniquement les composants experts pertinents dans la DRAM et à conserver les composants fréquemment utilisés dans le cache.

Le NPU prendrait en charge les formats de précision FP16, INT2, INT4, INT8 et FP8. Le Lec attribue à Qualcomm un pré-remplissage INT4 jusqu'à 50 % plus rapide et une réponse commençant en 1,5 seconde. Aucun test indépendant, disponibilité des appareils, prix ou produits de consommation spécifiques n'est fourni.

Détails de la source: thelec.net ↗

Pourquoi c'est important

Si la conception annoncée par Qualcomm atteint les appareils grand public comme décrit, elle pourrait rendre les systèmes d'IA plus grands et plus contextuels plus pratiques à exécuter localement sur les téléphones. Conserver davantage de données de modèle à proximité du processeur peut réduire le trafic mémoire et la latence, tandis que les architectures mixtes d'experts pourraient donner accès à des fonctionnalités spécialisées sans activer chaque paramètre pour chaque tâche. Cela est important pour la confidentialité, la réactivité et l'utilisation hors ligne, mais l'avantage pratique reste à vérifier jusqu'à ce que les appareils, les modèles et les tests indépendants soient disponibles.

L'annonce cible une contrainte centrale de l'IA mobile : exécuter des modèles performants dans des limites strictes de bande passante mémoire, d'utilisation de la batterie et de latence. Un pool de mémoire partagée plus grand et l’activation sélective de composants mixtes pourraient réduire la quantité de données déplacées lors de l’inférence locale, si l’architecture de Qualcomm fonctionne comme décrit.

Le traitement local peut présenter des avantages pratiques, car certaines interactions peuvent être gérées sur un téléphone sans envoyer chaque entrée à un service distant. Cependant, la source n'établit pas de garanties de confidentialité, de fonctionnalités hors ligne, d'améliorations de la batterie ou de performances sur les applications réelles. Ces résultats dépendent du logiciel, de la compression du modèle, des limites thermiques et de la mise en œuvre du combiné.

L'intégration signalée avec le CPU et le GPU suggère que Qualcomm traite l'IA agentique comme une charge de travail de plate-forme plutôt que comme une fonctionnalité d'accélérateur isolée. Son importance dépendra de la capacité des développeurs à accéder efficacement au matériel et de la capacité des fabricants de téléphones à proposer des modèles et des applications qui l'utilisent.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Vérification de concept interactive+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Que regarder ensuite

La prochaine preuve significative sera les révélations du Snapdragon Summit de Qualcomm et les éventuels appareils utilisant le NPU. Surveillez les plates-formes de puces nommées, les modèles pris en charge, les outils de développement, les mesures réelles sur l'appareil, la consommation d'énergie soutenue et si les temps de réponse revendiqués s'appliquent à des flux de travail agents complets plutôt qu'à des démonstrations limitées. La disponibilité, les prix et la distribution régionale ne sont pas documentés dans le rapport.

Qualcomm indique que de plus amples détails seront révélés lors du Snapdragon Summit du 22 au 24 septembre. Ces divulgations pourraient clarifier la plate-forme Snapdragon spécifique, le calendrier de déploiement, les environnements d'exploitation pris en charge et l'accès des développeurs.

Des tests indépendants devraient vérifier l'amélioration des performances INT4 signalée, la demande de démarrage de réponse en 1,5 seconde, la consommation d'énergie et les performances soutenues sous des charges de travail agentiques en plusieurs étapes. La source ne fournit aucun test de ce type.

On ne sait pas encore quels smartphones utiliseront le NPU, quand ils parviendront aux clients, combien ils coûteront ou si toutes les fonctionnalités signalées seront activées au lancement.

Guides et quiz associés

Agents IAModèles d'IA expliquésTransformateursTestez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaireSuivez le suivi des versions du modèle AI
Vous avez trouvé cela utile ?