À suivreGuide suivant
Pré-entraînement continu vs réglage fin
Technique
GUIDE Technique
Affiner un modèle d'intégration signifie l'entraîner sur des paires de requêtes réelles et les documents qui y répondent, de sorte que dans votre domaine, le texte pertinent se rapproche dans l'espace vectoriel que le texte non pertinent.
C'est important car la qualité de la récupération limite la qualité du RAG : si le bon passage n'est pas récupéré, le modèle de langage ne peut pas l'utiliser, et les intégrations à usage général manquent souvent le vocabulaire du domaine, les abréviations et la façon dont vos utilisateurs formulent les questions.
Un modèle d'intégration transforme le texte en vecteur afin que les textes sémantiquement similaires aient des vecteurs similaires, généralement mesurés par la similarité cosinus. Dans RAG, les requêtes et les fragments de documents sont intégrés et les fragments les plus proches sont récupérés. Les modèles généraux sont formés sur des données Web étendues et des questions-réponses. Ils fonctionnent raisonnablement bien partout, mais peuvent avoir des difficultés avec les termes spécialisés, les noms de produits internes et l'écart entre la manière dont un utilisateur demande et la manière dont un document est rédigé. Le réglage fin comble cet écart avec des données de formation sous trois formes. Les paires positives sont une requête et un passage qui y répond. Les négatifs du lot utilisent les autres passages du même lot de formation comme exemples de ce qui devrait obtenir un score inférieur. Les négatifs durs sont des passages qui semblent pertinents, partageant des mots ou un sujet, mais qui ne répondent pas à la requête. Les négatifs durs enseignent les distinctions fines qui comptent le plus, car les négatifs faciles sont déjà séparés par le modèle de base. Les bonnes sources de données incluent les journaux de recherche avec clics, les tickets d'assistance liés aux articles, les pages FAQ et les requêtes synthétiques générées à partir de vos documents par un modèle de langage. Les données synthétiques sont utiles mais doivent être filtrées, car les questions générées copient souvent le libellé du document et rendent la tâche trop facile. Une idée fausse fréquente est que le réglage fin est la première solution à une mauvaise récupération. Souvent, un meilleur regroupement, l'ajout d'une recherche par mot-clé tel que BM25 dans une configuration hybride, ou l'ajout d'un reranker donne des gains plus importants avec moins d'effort. Un réglage fin est plus intéressant lorsque vous avez mesuré un écart de récupération et que vous avez ou pouvez construire au moins quelques milliers de paires de qualité. Un autre piège concerne les faux négatifs : un négatif dur extrait qui répond réellement à la requête. Entraîner le modèle pour le repousser nuit à la qualité. Notez également que la modification du modèle d'intégration nécessite de réintégrer l'intégralité de la collection de documents, car les anciens et les nouveaux vecteurs ne sont pas comparables.
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
Les modèles d'intégration généraux continuent de s'améliorer par rapport aux références publiques telles que le MTEB, ce qui réduit mais ne supprime pas l'avantage de l'adaptation de domaine, puisque les données de référence correspondent rarement à un corpus privé. La génération de données synthétiques avec des modèles de langage a rendu le réglage précis pratique pour les équipes ne disposant pas de grands ensembles de données étiquetées. Attendez-vous à une utilisation continue de pipelines hybrides dans lesquels un modèle d'intégration affiné gère le rappel de première étape et un reranker gère la précision. L'habitude de mesurer compte le plus : les équipes qui suivent le rappel sur des requêtes réelles sauront quand un réglage fin est payant.
Une compagnie d'assurance forme des intégrations sur des paires de questions de clients et sur les clauses de police qui y répondent. Ainsi, « mon téléphone est-il couvert si je le laisse tomber » récupère la clause de dommages accidentels.
Un éditeur de logiciels utilise l'historique de ses tickets d'assistance, en associant la question de chaque ticket aux agents de l'article d'aide liés dans leur réponse, en tant que données de formation gratuites.
Une équipe de recherche juridique exploite les éléments négatifs en prenant des clauses qui partagent des mots-clés avec la requête mais s'adressent à une juridiction différente, apprenant au modèle à les séparer.
Une équipe pharmaceutique génère des questions synthétiques à partir de documents internes avec un modèle de langage, filtre celles de mauvaise qualité et utilise les paires pour former un modèle d'intégration de domaine.
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Affiner un modèle d'intégration signifie l'entraîner sur des paires de requêtes réelles et les documents qui y répondent, de sorte que dans votre domaine, le texte pertinent se rapproche dans l'espace vectoriel que le texte non pertinent. C'est important car la qualité de la récupération limite la qualité du RAG : si le bon passage n'est pas récupéré, le modèle de langage ne peut pas l'utiliser, et les intégrations à usage général manquent souvent le vocabulaire du domaine, les abréviations et la façon dont vos utilisateurs formulent les questions.
Les négatifs durs partagent des mots ou un sujet avec la requête mais ne sont pas corrects, enseignant ainsi au modèle de fines distinctions.
Les négatifs faciles sont déjà loin d’être la question ; les négatifs durs forcent le modèle à apprendre des différences subtiles.
Si une réponse supposée négative est réellement pertinente, la formation repousse une réponse correcte et nuit à la récupération.
Les pertes contrastées marquent le positif par rapport aux négatifs du lot et aux négatifs durs, poussant le positif vers le haut.
Les vecteurs de différents modèles ne sont pas comparables, c'est pourquoi toute la collection doit être réintégrée.
Continuez à apprendre
Plus de guides sélectionnés pour ce sujet
À suivreGuide suivant
Pré-entraînement continu vs réglage fin
Technique