À suivreGuide suivant
California SB 53 et Frontier AI Transparency
Société
GUIDE DE LA SOCIÉTÉ
Un cadre de sécurité de l'IA de pointe, tel qu'une politique de mise à l'échelle responsable, est un engagement publié par un laboratoire d'IA à tester ses modèles pour détecter les capacités dangereuses.
Si un modèle dépasse un seuil défini, le laboratoire s'engage à ajouter des garanties plus strictes, ou à ne pas déployer ou ne pas poursuivre la formation tant que ces garanties ne sont pas en place. Ces cadres sont importants car ils constituent actuellement le principal moyen de régir les modèles d’IA les plus avancés en matière de risques catastrophiques, bien que la plupart d’entre eux soient volontaires et rédigés par les laboratoires eux-mêmes.
Anthropic a publié la première politique de mise à l'échelle responsable en septembre 2023. Elle a introduit des niveaux de sécurité de l'IA (ASL), vaguement calqués sur les niveaux de biosécurité, où des niveaux plus élevés nécessitent des garanties de sécurité et de déploiement plus strictes. Une version ultérieure, en octobre 2024, a reformulé la politique en termes de seuils de capacité et de garanties requises et a décrit le rôle d'un responsable de mise à l'échelle. OpenAI a publié son cadre de préparation en version bêta en décembre 2023. Il a évalué les risques dans les catégories suivies, comprenant à l'origine les menaces CBRN, la cybersécurité, la persuasion et l'autonomie des modèles. Une révision de 2025 l'a réorganisé autour de seuils de capacité élevée et critique et a abandonné la persuasion en tant que catégorie suivie. Google DeepMind a publié son cadre de sécurité aux frontières en mai 2024 et l'a révisé depuis. Il définit les niveaux de capacité critique (CCL) qui déclenchent les plans d'intervention. Lors du sommet AI de Séoul en mai 2024, 16 entreprises ont signé les engagements de sécurité Frontier AI. Ils ont convenu de publier des cadres de sécurité, de fixer des seuils de risque intolérable et de ne pas développer ou déployer de modèle si ses risques ne pouvaient pas être maintenus en dessous de ces seuils. De nombreux cadres ont été publiés avant le Paris AI Action Summit en février 2025. Les critiques pointent plusieurs faiblesses. Les laboratoires rédigent leurs propres seuils et peuvent les réviser eux-mêmes. Des expressions telles que « amélioration significative » laissent place à l'interprétation. La vérification externe est limitée et la concurrence commerciale incite les laboratoires à lire généreusement les résultats. Une idée fausse courante est que ces cadres sont des lois. La plupart sont volontaires, même si cela est en train de changer. Le SB 53 de Californie exige que les grands développeurs pionniers publient un tel cadre, et le Code de bonnes pratiques de l'IA à usage général de l'UE, une voie volontaire pour démontrer la conformité à la loi sur l'IA, demande aux signataires d'en adopter un.
Les dommages catastrophiques et quotidiens causés par l’IA dépendent tous deux de la personne qui comprend les risques et qui peut agir.
Les connaissances du public et des professionnels déterminent si une politique de sécurité forte est politiquement possible.
Des explications claires réduisent la capture par le battage médiatique, les relations publiques en laboratoire et le théâtre d'éthique vague.
Les cadres évoluent d’engagements volontaires vers des attentes réglementaires. La Californie exige désormais que les grands développeurs pionniers les publient, le Code de bonnes pratiques de l'UE demande aux signataires de les adopter, et d'autres juridictions pourraient suivre. Les questions ouvertes incluent qui vérifie la conformité, comment les seuils sont standardisés dans les laboratoires et si les évaluations peuvent suivre l'amélioration rapide des systèmes d'agents. Des organismes de test indépendants, notamment des instituts gouvernementaux d’IA, pourraient jouer un rôle plus important dans la vérification des allégations des laboratoires. La tension centrale persistera probablement : les laboratoires conçoivent les règles selon lesquelles ils sont jugés, ce qui rend la transparence et un contrôle extérieur importants.
Avant sa sortie, un laboratoire teste si un nouveau modèle donne un coup de pouce significatif à quelqu'un qui tente d'acquérir des armes biologiques. S’il dépasse le seuil, le laboratoire ajoute des filtres d’utilisation abusive et une sécurité plus strictes avant le déploiement.
En mai 2025, Anthropic a déclaré avoir activé le déploiement ASL-3 et les protections de sécurité pour le Claude Opus 4 par mesure de précaution, car il ne pouvait pas exclure que le modèle ait atteint le seuil de capacité pertinent.
Le cadre de préparation de OpenAI ordonne à un groupe consultatif de sécurité d'examiner les rapports de capacité et de conseiller les dirigeants sur la question de savoir si les mesures de protection sont adéquates avant une publication.
Un laboratoire qui suit la réplication autonome ou l’accélération de la recherche en IA exécute des évaluations agentiques. Ceux-ci testent si le modèle peut effectuer des tâches longues et en plusieurs étapes sans aide humaine.
Traiter le risque existentiel comme de la science-fiction alors que les capacités s’accroissent.
Confondre sécurité des produits de surface et alignement sous haute autonomie.
Laisser le public non anglophone et non expert avec uniquement des sources de mauvaise qualité.
Séparez les dommages causés aux produits, leur mauvaise utilisation et les risques de perte de contrôle/désalignement.
Demandez quelles preuves pourraient changer votre point de vue sur les délais et la gravité.
Préférez les sources primaires et les évaluations concrètes aux allégations marketing.
Identifiez une voie d’action : carrière, politique, financement ou compétences – et pas seulement la sensibilisation.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Un cadre de sécurité de l'IA de pointe, tel qu'une politique de mise à l'échelle responsable, est un engagement publié par un laboratoire d'IA à tester ses modèles pour détecter les capacités dangereuses. Si un modèle dépasse un seuil défini, le laboratoire s'engage à ajouter des garanties plus strictes, ou à ne pas déployer ou ne pas poursuivre la formation tant que ces garanties ne sont pas en place. Ces cadres sont importants car ils constituent actuellement le principal moyen de régir les modèles d’IA les plus avancés en matière de risques catastrophiques, bien que la plupart d’entre eux soient volontaires et rédigés par les laboratoires eux-mêmes.
Ces cadres reposent sur des engagements « si-alors » qui lient les seuils de capacité aux garanties requises.
La politique de mise à l'échelle responsable de Anthropic de septembre 2023 a introduit des ASL, vaguement calquées sur les niveaux de biosécurité.
DeepMind utilise des niveaux de capacité critique (CCL), qui déclenchent des plans d'intervention lorsqu'ils sont atteints.
Les engagements de sécurité de Frontier AI étaient des engagements volontaires à publier des cadres et à ne pas poursuivre si les risques ne pouvaient pas être maintenus en dessous des seuils.
La révision a réorganisé le cadre autour des seuils élevés et critiques et a supprimé la persuasion en tant que catégorie suivie.
Continuez à apprendre
Plus de guides sélectionnés pour ce sujet
À suivreGuide suivant
California SB 53 et Frontier AI Transparency
Société