अध्ययन से पता चलता है कि छोटे पैमाने के वैक्टर बड़े भाषा मॉडल प्रशिक्षण को भौतिक रूप से प्रभावित कर सकते हैं
एक संशोधित arXiv अध्ययन का तर्क है कि एलएलएम सामान्यीकरण परतों के अंदर सीखने योग्य छोटे वैक्टर का प्रशिक्षण पर उनके पैरामीटर गणना से अधिक प्रभाव पड़ता है। लेखक घने और विशेषज्ञों के मिश्रण वाले मॉडलों में कई हल्के बदलावों से कम प्रशिक्षण हानि की रिपोर्ट करते हैं, लेकिन सार यह प्रदान नहीं करता है…