Studie zjistila, že malé vektory měřítka mohou významně ovlivnit trénink velkých jazykových modelů
Revidovaná studie arXiv tvrdí, že malé naučitelné vektory uvnitř normalizačních vrstev LLM mají větší vliv na trénink, než naznačuje počet jejich parametrů. Autoři uvádějí nižší tréninkové ztráty z několika lehkých změn napříč hustými a smíšenými modely odborníků, ale abstrakt neposkytuje…