O que aconteceu
O Lec relata que a Qualcomm revelou uma unidade de processamento neural Hexagon de próxima geração em 10 de setembro para cargas de trabalho contínuas de IA em dispositivos móveis. O design relatado adiciona um Element Accelerator para cargas de trabalho de transformadores, aumenta a memória compartilhada em 50% e oferece suporte a modelos mistos de especialistas com até 30 bilhões de parâmetros, com cerca de 3 bilhões ativos para cada token gerado. De acordo com The Lec, o NPU suporta os formatos de dados FP16, INT2, INT4, INT8 e FP8. A Qualcomm afirma que o desempenho do pré-preenchimento do INT4 pode ser até 50% mais rápido e que as respostas podem começar em 1,5 segundos, embora o Lec não relate testes independentes desses números. O NPU foi projetado para funcionar com a CPU Oryon da Snapdragon e a GPU Adreno para fluxos de trabalho de várias etapas e processamento de IA relacionado a gráficos. O relatório diz que a Qualcomm fornecerá mais detalhes no Snapdragon Summit nos Estados Unidos, de 22 a 24 de setembro. A fonte não identifica um smartphone específico, data de lançamento, disponibilidade no varejo, preço ou resultados confirmados de benchmark de terceiros.
O Lec relata que a Qualcomm revelou seu NPU Hexagon de próxima geração em 10 de setembro, posicionando-o como hardware móvel para sistemas de IA que interpretam o contexto, raciocinam entre aplicativos e executam tarefas para os usuários. O hardware relatado adiciona um Element Accelerator junto com extensões escalares, vetoriais e matriciais existentes, com o objetivo de melhorar a computação do modelo de transformador enquanto gerencia o uso de energia.
O relatório afirma que a capacidade de memória compartilhada é 50% maior do que no design anterior. A justificativa declarada da Qualcomm é que manter o estado do modelo, as ativações e os dados do tensor intermediário mais próximos do processador pode reduzir as transferências para DRAM externa, melhorando potencialmente a retenção de contexto e a alternância de tarefas. O relatório não fornece uma comparação independente com uma implementação anterior da Hexagon.
O novo Hexagon supostamente suporta modelos mistos de especialistas com até 30 bilhões de parâmetros, enquanto ativa cerca de 3 bilhões de parâmetros roteados por token. O Lec também relata gerenciamento e cache NAND flash-to-memory destinados a carregar apenas os componentes especializados relevantes na DRAM e reter componentes usados com frequência no cache.
O NPU supostamente suporta formatos de precisão FP16, INT2, INT4, INT8 e FP8. O Lec atribui reivindicações de pré-preenchimento INT4 até 50% mais rápido e início de resposta em 1,5 segundos para a Qualcomm. Não são fornecidos testes independentes, disponibilidade de dispositivos, preços ou produtos de consumo específicos.
Detalhes da fonte: thelec.net ↗
Por que isso importa
Se o design relatado da Qualcomm chegar aos dispositivos de consumo conforme descrito, isso poderá tornar mais práticos sistemas de IA maiores e mais sensíveis ao contexto para serem executados localmente em telefones. Manter mais dados do modelo perto do processador pode reduzir o tráfego de memória e a latência, enquanto arquiteturas mistas de especialistas podem fornecer acesso a recursos especializados sem ativar todos os parâmetros para cada tarefa. Isto é importante para a privacidade, capacidade de resposta e utilização offline, mas o benefício prático permanece não verificado até que dispositivos, modelos e testes independentes estejam disponíveis.
O anúncio visa uma restrição central na IA móvel: executar modelos capazes dentro de limites rígidos de largura de banda de memória, uso de bateria e latência. Um pool maior de memória compartilhada e a ativação seletiva de componentes mistos de especialistas poderiam reduzir a quantidade de dados movidos durante a inferência local, se a arquitetura da Qualcomm funcionar conforme descrito.
O processamento local pode trazer benefícios práticos porque algumas interações podem ser realizadas por telefone sem enviar todas as entradas para um serviço remoto. No entanto, a fonte não estabelece garantias de privacidade, funcionalidade offline, melhorias de bateria ou desempenho em aplicações reais. Esses resultados dependem do software, da compressão do modelo, dos limites térmicos e da implementação do aparelho.
A integração relatada com CPU e GPU sugere que a Qualcomm está tratando a IA de agente como uma carga de trabalho de plataforma, em vez de um recurso de acelerador isolado. Sua importância dependerá de os desenvolvedores conseguirem acessar o hardware de maneira eficiente e de os fabricantes de telefones enviarem modelos e aplicativos que o utilizem.
Mecanismo interativo: como realmente funciona
Explore a tecnologia subjacente a este desenvolvimento de forma interativa.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
O que assistir a seguir
A próxima evidência significativa serão as divulgações do Snapdragon Summit da Qualcomm e eventuais dispositivos que usam o NPU. Fique atento às plataformas de chips nomeadas, aos modelos suportados, às ferramentas de desenvolvedor, às medições reais no dispositivo, ao consumo sustentado de energia e se os tempos de resposta declarados se aplicam a fluxos de trabalho de agente completos, em vez de demonstrações limitadas. Disponibilidade, preços e distribuição regional não estão documentados no relatório.
A Qualcomm afirma que mais detalhes serão revelados no Snapdragon Summit, de 22 a 24 de setembro. Essas divulgações podem esclarecer a plataforma Snapdragon específica, o cronograma de implantação, os ambientes operacionais suportados e o acesso do desenvolvedor.
Testes independentes devem verificar a melhoria de desempenho relatada do INT4, a reivindicação de início de resposta de 1,5 segundo, o consumo de energia e o desempenho sustentado sob cargas de trabalho de agente de várias etapas. A fonte não fornece tais testes.
Ainda não se sabe quais smartphones usarão o NPU, quando chegarão aos clientes, quanto custarão ou se todas as capacidades relatadas serão habilitadas no lançamento.