Kajian mendapati vektor skala kecil boleh menjejaskan latihan model bahasa yang besar
Kajian arXiv yang disemak berpendapat bahawa vektor kecil yang boleh dipelajari di dalam lapisan normalisasi LLM mempunyai kesan yang lebih besar pada latihan daripada yang dicadangkan oleh kiraan parameternya. Penulis melaporkan kehilangan latihan yang lebih rendah daripada beberapa perubahan ringan merentas model padat dan campuran pakar, tetapi abstrak tidak memberikan…