Estudo descobre que vetores de pequena escala podem afetar materialmente o treinamento de modelos de linguagem de grande porte
Um estudo arXiv revisado argumenta que os pequenos vetores que podem ser aprendidos dentro das camadas de normalização LLM têm um efeito maior no treinamento do que sugere sua contagem de parâmetros. Os autores relatam menor perda de treinamento devido a várias mudanças leves em modelos densos e mistos de especialistas, mas o resumo não fornece…