Badanie wykazało, że wektory o małej skali mogą w istotny sposób wpływać na uczenie dużych modeli językowych
Zrewidowane badanie arXiv dowodzi, że małe wektory, których można się nauczyć wewnątrz warstw normalizacyjnych LLM, mają większy wpływ na uczenie, niż sugeruje ich liczba parametrów. Autorzy zgłaszają mniejsze straty treningowe w wyniku kilku lekkich zmian w modelach gęstych i mieszanych, ale streszczenie nie dostarcza…