O que aconteceu
Um artigo revisado em arXiv em 28 de agosto propõe Mistura de Ativações, ou MoA, para modelos de linguagem baseados em . O design usa portas leves e dependentes de entrada para combinar várias funções de ativação para tokens individuais, enquanto compartilha as mesmas projeções lineares. Os autores também introduzem ativações que podem ser aprendidas que combinam funções sem portas dependentes de .
A fonte oficial é um registro arXiv para “Camadas Feedforward Mais Expressivas: Parte I. Mistura de Ativações -Adaptive”. Diz que o artigo foi submetido pela primeira vez em 26 de maio de 2026 e revisado em 28 de agosto, colocando a atualização substantiva dentro da janela de notícias atual. Os autores são Mingze Wang, Jinbo Wang, Yikuan Xia, Kai Shen e Shu Zhong. A fonte identifica o trabalho como um artigo sobre aprendizado de máquina e inteligência artificial, tendo modelos de linguagem como tema direto.
O artigo parte de uma limitação que os autores identificam nas camadas comuns da rede feedforward, ou FFN. Projetos anteriores usavam funções como ReLU e GELU, enquanto projetos posteriores incluem SwiGLU, mas a fonte diz que a maioria dos FFNs ainda aplica uma transformação não linear fixa a cada . A Mistura de Ativações proposta usa, em vez disso, um dicionário de funções de ativação e portas leves cujos valores dependem da entrada. As mesmas projeções lineares são compartilhadas, enquanto a mistura de funções não lineares pode variar de token para token.
A fonte também descreve ativações que podem ser aprendidas, abreviadas como LA, como uma contrapartida independente de entrada. LA forma combinações lineares de funções de ativação em FFNs do tipo ReLU e do tipo SwiGLU. Os autores afirmam que sua teoria de largura finita estabelece separações expressivas estritas: LA contém estritamente FFNs de ativação fixa, enquanto MoA contém estritamente LA porque adiciona hibridização não linear dependente de entrada. Estas são afirmações teóricas de expressividade sobre as funções que as camadas podem representar, e não evidências de que um modelo de linguagem implantado seja geralmente mais capaz ou confiável.
Para testes empíricos, os autores afirmam ter conduzido extensos experimentos de pré-treinamento em modelos de linguagem densos e mistos de especialistas, variando de 0,12 bilhão a 2 bilhões de parâmetros. Eles relatam testes de diferentes orçamentos de tokens, otimizadores e programações de taxas de aprendizagem. De acordo com o resumo, o MoA alcançou consistentemente menor perda terminal e mostrou um comportamento de escala mais favorável do que linhas de base bem ajustadas, com parâmetros mínimos e sobrecarga computacional. O registro de origem não fornece as diferenças numéricas de perdas, os nomes dos conjuntos de dados ou linhas de base, detalhes de hardware ou o significado preciso de sobrecarga “mínima”.
Detalhes da fonte: arxiv.org ↗
Por que isso importa
As camadas feedforward contêm uma grande parte dos parâmetros e do comportamento não linear em muitos modelos de linguagem. Se a mistura de ativação adaptativa de melhorar o treinamento sem aumentar materialmente a computação ou os parâmetros, ela poderá oferecer uma mudança arquitetural relativamente pequena com implicações para o dimensionamento do modelo. As evidências permanecem limitadas aos experimentos de pré-treinamento relatados pelos autores e não estabelecem melhor desempenho posterior ou eficiência de produção.
A proposta visa uma parte importante da atual arquitetura do modelo de linguagem. A fonte diz que as camadas FFN representam uma grande fração dos parâmetros do modelo e da expressividade não linear. Isso os torna um local importante para buscar melhorias: uma mudança na transformação não linear poderia afetar a eficiência com que um modelo usa sua largura e projeções existentes, em vez de exigir uma família de modelos totalmente diferente.
O design do MoA é potencialmente prático porque retém projeções lineares compartilhadas e adiciona gating leve e dependente de entrada. Em princípio, isso poderia permitir que diferentes tokens recebessem diferentes tratamentos não lineares, preservando grande parte da estrutura FFN circundante. No entanto, a fonte não estabelece que os modelos existentes possam ser atualizados sem reciclagem, nem relata detalhes de implementação suficientes para determinar se as portas adicionadas melhoram o rendimento, o uso de memória ou o consumo de energia no mundo real.
A menor perda terminal relatada é relevante porque a perda de treinamento é uma medida central de quão bem um modelo se ajusta aos seus dados de pré-treinamento. O comportamento de dimensionamento alegado também pode ser importante se o método continuar a melhorar à medida que o tamanho do modelo ou a computação de treinamento aumentarem. Mas perda terminal não é o mesmo que utilidade para as pessoas. A fonte não fornece resultados de factualidade, raciocínio, codificação, desempenho multilingue, segurança, calibração, robustez ou precisão da tarefa a jusante, pelo que o significado prático dos ganhos de formação relatados permanece incerto.
A evidência também é preliminar. Ele vem de um preprint revisado, e o registro fonte apresenta as conclusões teóricas e empíricas dos autores, em vez de uma validação independente. A faixa testada termina em 2 bilhões de parâmetros, o que é materialmente menor do que muitos modelos de linguagem amplamente implantados. O registro não indica se os experimentos usaram múltiplas sementes aleatórias, como as linhas de base foram ajustadas, se o método altera a latência de inferência ou se seus ganhos persistem fora das configurações de pré-treinamento relatadas.
Mecanismo interativo: como realmente funciona
Explore a tecnologia subjacente a este desenvolvimento de forma interativa.
Which component of an AI application is the machine-learning model itself?
O que assistir a seguir
A próxima evidência importante é o tamanho e a consistência dos ganhos relatados, especialmente além da faixa testada de 0,12B a 2B. Os leitores devem procurar por sobrecarga exata de computação, memória, latência e parâmetros; resultados em tarefas posteriores; replicação independente; e evidências de que o método permanece útil em arquiteturas, conjuntos de dados, otimizadores e execuções de treinamento mais longas.
A próxima verificação útil são os detalhes quantitativos. O artigo completo ou trabalho posterior deve mostrar curvas de perda exatas, confiança ou variação de execução para execução, contagens de parâmetros, contagens de operações, requisitos de memória e custos de treinamento de relógio de parede para MoA, LA e linhas de base de ativação fixa. Como o resumo diz que as comparações foram feitas com linhas de base bem ajustadas, o procedimento de ajuste e o orçamento computacional serão importantes para julgar se a vantagem vem da arquitetura e não da otimização desigual.
A escala é outra questão não resolvida. A fonte relata modelos de parâmetros de 0,12B a 2B, mas não diz se o mesmo padrão se mantém em sistemas densos substancialmente maiores ou em sistemas mistos de especialistas. Experimentos futuros devem testar modelos maiores, execuções de treinamento mais longas, orçamentos adicionais de tokens e diferentes combinações de dados. Eles também devem esclarecer se o comportamento de escalonamento favorável alegado é medido pela perda em um orçamento de computação fixo, pela perda em uma contagem de parâmetros fixos ou por outra comparação.
Os custos operacionais merecem muita atenção. MoA introduz uma porta dependente de e um dicionário de funções de ativação, mesmo que o parâmetro adicionado e a carga de computação sejam descritos como mínimos. Medições independentes devem determinar se isso produz mudanças significativas na utilização do acelerador, tráfego de memória, processamento em lote, latência de inferência, estabilidade de treinamento ou uso de energia. Uma pequena sobrecarga teórica pode ter um custo de sistema maior se interromper a execução eficiente do hardware.
Finalmente, os leitores devem procurar replicação independente e avaliação mais ampla. Os resultados sobre linguagem downstream, codificação, raciocínio e tarefas multilíngues mostrariam se a menor perda de pré-treinamento é transferida para recursos que os usuários percebem. Avaliações de confiabilidade e segurança testariam se o comportamento não linear adaptativo de introduz novos padrões de falha. Até que esses resultados estejam disponíveis, o artigo é melhor entendido como uma afirmação promissora de pesquisa arquitetônica, e não como uma melhoria demonstrada na produção ou como um produto imediatamente disponível.