Дослідження виявило, що крихітні масштабні вектори можуть істотно вплинути на навчання великої мовної моделі
У переглянутому дослідженні arXiv стверджується, що невеликі вектори, які можна вивчати всередині шарів нормалізації LLM, мають більший вплив на навчання, ніж передбачає їх кількість параметрів. Автори повідомляють про меншу втрату під час навчання внаслідок кількох легких змін у щільних і змішаних експертних моделях, але анотація не надає…