À suivreGuide suivant
Optimisation du second ordre et méthodes de Newton
Technique
GUIDE Technique
La détection des hallucinations est l'ensemble des techniques permettant de signaler les résultats du modèle qui sont faux ou non étayés par des preuves.
Les principales méthodes consistent à échantillonner plusieurs réponses et à vérifier si elles concordent, à tester si chaque affirmation est impliquée par des documents sources, à lire des signaux d'incertitude tels que des probabilités symboliques et à demander à un deuxième modèle d'agir en tant que juge. C’est important parce que les textes hallucinés sont souvent lus avec fluidité et confiance, les systèmes de production ont donc besoin de contrôles automatisés avant que les erreurs n’atteignent les utilisateurs.
La détection pose une question plus précise que celle de savoir pourquoi les modèles hallucinent : étant donné un résultat, peut-on lui faire confiance ? Les systèmes robustes combinent généralement plusieurs des méthodes ci-dessous. Les contrôles d’auto-cohérence reposent sur une simple observation. Lorsqu'un modèle connaît un fait, les échantillons répétés ont tendance à concorder, tandis que les détails fabriqués ont tendance à varier. SelfCheckGPT (Manakul et al., 2023) l’a formalisé. Il génère plusieurs réponses et mesure si chaque phrase de la réponse principale est soutenue par les autres. La méthode ne nécessite aucune source externe. Les inconvénients sont les appels de modèle supplémentaires et les erreurs manquées lorsqu'un modèle répète à chaque fois la même mauvaise réponse. Les vérifications fondées sur la source comparent la sortie au texte de référence, ce qui convient aux systèmes de récupération augmentée. La réponse est divisée en affirmations atomiques, et chaque affirmation est testée pour son implication par rapport aux passages récupérés. L'implication signifie que le passage soutient logiquement la revendication. Le test utilise soit un modèle d'inférence en langage naturel, soit un LLM. Ces contrôles mesurent la fidélité aux sources, ce qui n'est pas la même chose que la vérité si les sources sont fausses. Les signaux d'incertitude utilisent les propres probabilités du modèle. De faibles probabilités de jetons ou une entropie élevée sur des étendues clés telles que des noms, des nombres et des dates peuvent indiquer une supposition. L'entropie sémantique (Farquhar et al., publié dans Nature en 2024) regroupe les réponses échantillonnées par sens avant de mesurer l'incertitude, de sorte que différentes formulations de la même réponse ne sont pas considérées comme un désaccord. Les signaux au niveau du jeton doivent accéder aux probabilités de journalisation, que certaines API limitent. Les modèles de juge demandent à un LLM solide de noter une réponse aux affirmations non étayées, généralement avec les sources et une rubrique jointe. Ils évoluent bien, mais les juges ont leurs propres préjugés et taux d’erreur, alors vérifiez-les par rapport aux étiquettes humaines. Une idée fausse courante est que demander à un modèle « êtes-vous sûr ? » détecte les erreurs de manière fiable. Les modèles peuvent abandonner les bonnes réponses ou défendre les mauvaises. Les chèques structurés sont plus fiables.
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
La détection devient une couche standard dans les produits d’IA, et les plateformes d’évaluation et les fournisseurs de cloud proposent désormais des contrôles d’ancrage et de fidélité. Les recherches se poursuivent sur la lecture des signes d'incertitude provenant des activations internes d'un modèle et sur la formation des modèles pour s'abstenir ou exprimer une confiance calibrée. Aucune méthode n'est complète. Les vérifications de mise à la terre ne peuvent pas corriger les mauvaises sources, et les signaux d'incertitude manquent d'erreurs sûres. L’orientation probable est celle de défenses en couches plutôt que d’un seul détecteur. Les contrôles déterministes bon marché viennent en premier, suivis par la vérification fondée, avec un examen humain pour les résultats à enjeux élevés.
Un outil de recherche juridique extrait chaque citation d'un projet de réponse et vérifie que chacune existe dans une base de données jurisprudentielle avant d'afficher la réponse.
Un robot de support qui utilise la récupération divise sa réponse en revendications individuelles et vérifie chacune d'elles par rapport aux articles d'aide récupérés. Les réclamations sans fondement sont remplacées par une note indiquant qu'elles n'ont pas pu être confirmées.
Un système pose cinq fois la même question factuelle avec l’échantillonnage aléatoire activé. Si les dates de naissance renvoyées diffèrent, la réponse est signalée comme faible confiance.
Chaque jour, un modèle de juge évalue un échantillon de résumés générés par rapport à une rubrique pour les déclarations non étayées, et une personne examine tout ce qu'il signale.
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
La détection des hallucinations est l'ensemble des techniques permettant de signaler les résultats du modèle qui sont faux ou non étayés par des preuves. Les principales méthodes consistent à échantillonner plusieurs réponses et à vérifier si elles concordent, à tester si chaque affirmation est impliquée par des documents sources, à lire des signaux d'incertitude tels que des probabilités symboliques et à demander à un deuxième modèle d'agir en tant que juge. C’est important parce que les textes hallucinés sont souvent lus avec fluidité et confiance, les systèmes de production ont donc besoin de contrôles automatisés avant que les erreurs n’atteignent les utilisateurs.
L’accord entre les échantillons est un indicateur de la connaissance. Les détails qui changent d’un échantillon à l’autre suggèrent que le modèle est en train de deviner.
Si un modèle se trompe de manière sûre et constante, ses échantillons concordent et la vérification réussit. La génération de plusieurs échantillons ajoute également des coûts.
Ces contrôles vérifient si les affirmations sont étayées par le texte de référence. Si la référence est fausse, une réponse fidèle peut toujours être fausse.
Le regroupement par sens signifie que différentes formulations d’une même réponse ne sont pas considérées comme un désaccord. Seules des réponses véritablement différentes augmentent le score d’incertitude.
Un devis requis peut être vérifié mécaniquement par rapport à la source, ce qui attrape les vérificateurs qui inventent leur justification.
Continuez à apprendre
Plus de guides sélectionnés pour ce sujet
À suivreGuide suivant
Optimisation du second ordre et méthodes de Newton
Technique