QLoRA et réglage fin 4 bits
QLoRA est une technique qui vous permet d'affiner un modèle de langage massif sur un seul GPU grand public en stockant le modèle gelé en seulement 4 bits par poids.
Aperçu
It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.
Plongée profonde
Normalement, peaufiner un modèle volumineux signifie charger chaque poids avec une précision de 16 bits et tous les mettre à jour, ce qui nécessite une énorme mémoire. QLoRA combine deux idées. Tout d’abord, il gèle le modèle pré-entraîné et le quantifie à 4 bits, réduisant ainsi la mémoire environ par quatre. Deuxièmement, il utilise LoRA : au lieu de mettre à jour les matrices de poids géantes, il injecte à côté d'elles de minuscules matrices d'adaptateurs de bas rang entraînables, de sorte que seuls quelques millions de paramètres sont mis à jour. La base 4 bits reste fixe tandis que les dégradés circulent uniquement à travers les petits adaptateurs. Introduit en 2023 par Dettmers et ses collègues, QLoRA a montré que le réglage fin d'un modèle 65B sur un GPU de 48 Go pouvait égaler la qualité d'un réglage fin complet de 16 bits.
Aperçu technique
QLoRA a introduit trois astuces. NF4 (NormalFloat 4 bits) est un type de données optimisé pour la distribution en cloche des poids neuronaux, offrant une meilleure précision que le plain int4. La double quantification compresse les constantes de quantification elles-mêmes, économisant ainsi de la mémoire supplémentaire. Les optimiseurs paginés utilisent la mémoire unifiée GPU-CPU pour absorber les pics lors de longues séquences, évitant ainsi les pannes de mémoire insuffisante. Lors des passages aller et retour, les poids de 4 bits sont déquantifiés à 16 bits juste à temps pour la multiplication matricielle, puis rejetés.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L'avenir de QLoRA et du réglage fin 4 bits
Le réglage fin 4 bits est devenu une pratique courante et la recherche s'oriente désormais vers une précision encore plus faible, y compris des représentations 2 bits et 1 bit (ternaire). Les schémas de quantification les plus récents comme AWQ, GPTQ et HQQ affinent davantage la précision, tandis que des techniques telles que QA-LoRA visent à maintenir le modèle quantifié même après la fusion des adaptateurs. À mesure que les modèles ouverts se développent, attendez-vous à ce que les outils permettant aux amateurs d’affiner plus de 70 milliards de modèles sur un seul GPU de jeu deviennent une routine et démocratisent la personnalisation.
Mise en œuvre dans le monde réel
Une startup peaufine un modèle 70B Llama sur un seul GPU de 48 Go pour créer un assistant de support client avec sa propre voix de marque sans louer de cluster de serveurs.
Un chercheur possédant un RTX 4090 grand public adapte du jour au lendemain un modèle ouvert à un ensemble de données de réponse à des questions médicales de niche.
Un développeur crée des dizaines de petits adaptateurs LoRA échangeables pour différentes tâches, partageant tous un modèle de base 4 bits chargé en mémoire.
Un amateur affine un modèle sur ses journaux de discussion personnels pour imiter un style d'écriture particulier à l'aide de matériel gratuit de qualité Colab.
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the QLoRA and 4-Bit Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Ajustement précis de l’échantillonnage de rejet
Questions fréquemment posées
What is QLoRA and 4-Bit Fine-Tuning?
QLoRA est une technique qui vous permet d'affiner un modèle de langage massif sur un seul GPU grand public en stockant le modèle gelé en seulement 4 bits par poids. Il a rendu possible la personnalisation de modèles à paramètres 65B sur du matériel qui ne pouvait auparavant gérer que des modèles d'une fraction de cette taille.
Quelle est l'idée principale d'économie de mémoire derrière la partie « 4 bits » de QLoRA ?
QLoRA stocke les poids pré-entraînés gelés à 4 bits par valeur, réduisant ainsi la mémoire environ quatre fois par rapport à 16 bits.
Lors du réglage fin de QLoRA, quels paramètres sont réellement mis à jour par descente de gradient ?
Le modèle de base est figé ; seules les matrices d'adaptateurs de bas rang injectées reçoivent des mises à jour de gradient, ce qui ne représente qu'une infime fraction des paramètres.
Qu’est-ce que NF4 dans le contexte de QLoRA ?
NF4 (NormalFloat 4 bits) est un type de données conçu autour de la distribution en cloche des poids du réseau neuronal pour une meilleure précision que le simple int4.
Quel problème les « optimiseurs paginés » dans QLoRA résolvent-ils ?
Les optimiseurs paginés utilisent la mémoire unifiée GPU-CPU pour absorber les pics de mémoire, évitant ainsi les pannes de mémoire insuffisante lors de l'entraînement sur de longues entrées.
Quand les poids 4 bits sont-ils reconvertis en une plus grande précision pendant l'entraînement ?
Les poids de 4 bits sont déquantifiés à la volée avec une précision de 16 bits pour chaque multiplication matricielle, puis la copie de plus haute précision est jetée pour économiser de la mémoire.