Исследование показало, что вектора крошечного масштаба могут существенно повлиять на обучение крупномасштабной языковой модели
Пересмотренное исследование arXiv утверждает, что небольшие обучаемые векторы внутри слоев нормализации LLM оказывают большее влияние на обучение, чем предполагает количество их параметров. Авторы сообщают о меньших потерях при обучении из-за нескольких легких изменений в моделях с плотной структурой и моделями со смешанным участием экспертов, но в аннотации не содержится…