Wat is er gebeurd
De Lec meldt dat Qualcomm op 10 september een Hexagon neurale verwerkingseenheid van de volgende generatie heeft onthuld voor continue agentische AI-workloads op mobiele apparaten. Het gerapporteerde ontwerp voegt een Element Accelerator toe voor transformatorworkloads, vergroot het gedeelde geheugen met 50% en ondersteunt mix-of-experts-modellen met maximaal 30 miljard parameters, waarbij er ongeveer 3 miljard actief zijn voor elk gegenereerd token. Volgens The Lec ondersteunt de NPU de dataformaten FP16, INT2, INT4, INT8 en FP8. Qualcomm beweert dat de prefill-prestaties van INT4 tot 50% sneller kunnen zijn en dat de reacties binnen 1,5 seconde kunnen beginnen, hoewel The Lec geen onafhankelijke tests van die cijfers rapporteert. De NPU is bedoeld om te werken met Snapdragon’s Oryon CPU en Adreno GPU voor meerstapsworkflows en grafische AI-verwerking. Het rapport zegt dat Qualcomm meer details zal geven op de Snapdragon Summit in de Verenigde Staten van 22 tot 24 september. De bron identificeert geen specifieke smartphone, lanceringsdatum, beschikbaarheid in de winkel, prijs of bevestigde benchmarkresultaten van derden.
De Lec meldt dat Qualcomm op 10 september zijn Hexagon NPU van de volgende generatie heeft onthuld en deze heeft gepositioneerd als mobiele hardware voor AI-systemen die context interpreteren, over applicaties heen redeneren en taken uitvoeren voor gebruikers. De gerapporteerde hardware voegt een Element Accelerator toe naast bestaande scalaire, vector- en matrixuitbreidingen, met als doel de berekening van transformatormodellen te verbeteren en tegelijkertijd het stroomverbruik te beheren.
Volgens het rapport is de gedeelde geheugencapaciteit 50% hoger dan in het vorige ontwerp. De grondgedachte van Qualcomm is dat het dichter bij de processor houden van de modelstatus, activeringen en tussenliggende tensorgegevens de overdracht naar externe DRAM kan verminderen, waardoor mogelijk de contextretentie en het wisselen van taken worden verbeterd. Het rapport biedt geen onafhankelijke vergelijking met een eerdere Hexagon-implementatie.
De nieuwe Hexagon ondersteunt naar verluidt mix-of-experts-modellen met maximaal 30 miljard parameters, terwijl ongeveer 3 miljard gerouteerde parameters per token worden geactiveerd. De Lec rapporteert ook NAND flash-to-memory-beheer en caching, bedoeld om alleen de relevante expertcomponenten in DRAM te laden en veelgebruikte componenten in de cache te behouden.
De NPU ondersteunt naar verluidt de precisieformaten FP16, INT2, INT4, INT8 en FP8. De Lec schrijft claims van tot 50% snellere INT4-prefill en respons binnen 1,5 seconde toe aan Qualcomm. Er worden geen onafhankelijke tests, apparaatbeschikbaarheid, prijzen of specifieke consumentenproducten verstrekt.
Waarom het ertoe doet
Als het gerapporteerde ontwerp van Qualcomm consumentenapparaten bereikt zoals beschreven, zou het grotere en meer contextbewuste AI-systemen praktischer kunnen maken om lokaal op telefoons te draaien. Door meer modelgegevens dicht bij de processor te houden, kan het geheugenverkeer en de latentie worden verminderd, terwijl een mix van experts-architecturen toegang zou kunnen bieden tot gespecialiseerde mogelijkheden zonder elke parameter voor elke taak te activeren. Dat is van belang voor privacy, reactievermogen en offline gebruik, maar het praktische voordeel blijft ongeverifieerd totdat apparaten, modellen en onafhankelijke tests beschikbaar zijn.
De aankondiging richt zich op een centrale beperking in mobiele AI: het uitvoeren van capabele modellen binnen strikte limieten op het gebied van geheugenbandbreedte, batterijgebruik en latentie. Een grotere pool met gedeeld geheugen en selectieve activering van componenten van een mix van experts zouden de hoeveelheid gegevens die tijdens lokale inferentie worden verplaatst kunnen verminderen, als de architectuur van Qualcomm presteert zoals beschreven.
Lokale verwerking kan praktische voordelen hebben, omdat sommige interacties via een telefoon kunnen worden afgehandeld zonder dat elke invoer naar een externe service wordt gestuurd. De bron biedt echter geen privacygaranties, offline functionaliteit, batterijverbeteringen of prestaties voor echte applicaties. Deze uitkomsten zijn afhankelijk van software, modelcompressie, thermische limieten en implementatie van de handset.
De gerapporteerde integratie met de CPU en GPU suggereert dat Qualcomm agentische AI behandelt als een platformwerklast in plaats van als een geïsoleerde acceleratorfunctie. De betekenis ervan zal afhangen van de vraag of ontwikkelaars efficiënt toegang kunnen krijgen tot de hardware en of telefoonfabrikanten modellen en applicaties op de markt brengen die er gebruik van maken.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Wat je nu moet bekijken
Het volgende betekenisvolle bewijs zullen de onthullingen van Qualcomm’s Snapdragon Summit zijn en eventuele apparaten die de NPU gebruiken. Let op genoemde chipplatforms, ondersteunde modellen, ontwikkelaarstools, daadwerkelijke metingen op het apparaat, langdurig energieverbruik en of de geclaimde responstijden van toepassing zijn op volledige agentische workflows in plaats van op beperkte demonstraties. Beschikbaarheid, prijzen en regionale distributie zijn niet gedocumenteerd in het rapport.
Qualcomm zegt dat verdere details zullen worden onthuld op de Snapdragon Summit van 22 tot 24 september. Deze onthullingen kunnen het specifieke Snapdragon-platform, de implementatietijdlijn, ondersteunde besturingsomgevingen en toegang voor ontwikkelaars verduidelijken.
Onafhankelijke tests moeten de gerapporteerde prestatieverbetering van INT4, de respons-startclaim van 1,5 seconde, het energieverbruik en de duurzame prestaties onder meerstapsagentische werkbelastingen verifiëren. De bron biedt dergelijke tests niet.
Het is nog niet bekend welke smartphones de NPU zullen gebruiken, wanneer ze klanten zullen bereiken, wat ze zullen kosten en of alle gerapporteerde mogelijkheden bij de lancering zullen worden ingeschakeld.