Studiul descoperă că vectorii la scară mică pot afecta material pregătirea modelelor lingvistice mari
Un studiu arXiv revizuit susține că vectorii mici de învățare din straturile de normalizare LLM au un efect mai mare asupra antrenamentului decât sugerează numărul lor de parametri. Autorii raportează pierderi mai mici de antrenament din mai multe modificări ușoare în modele dense și mixte de experți, dar rezumatul nu oferă...