Une étude révèle que des vecteurs à petite échelle peuvent affecter matériellement la formation de modèles de langage à grande échelle
Une étude révisée arXiv soutient que les petits vecteurs apprenables à l'intérieur des couches de normalisation LLM ont un effet plus important sur la formation que ne le suggère leur nombre de paramètres. Les auteurs signalent une perte de formation plus faible grâce à plusieurs changements légers dans des modèles denses et mixtes d'experts, mais le résumé ne fournit pas…