Studie zeigt, dass winzige Skalenvektoren das Training großer Sprachmodelle erheblich beeinflussen können
Eine überarbeitete arXiv-Studie argumentiert, dass die kleinen lernbaren Vektoren innerhalb der LLM-Normalisierungsschichten einen größeren Einfluss auf das Training haben, als ihre Parameteranzahl vermuten lässt. Die Autoren berichten von einem geringeren Trainingsverlust durch mehrere leichte Änderungen in dichten Modellen und Modellen mit gemischten Experten, aber die Zusammenfassung liefert keine Angaben …