Que s'est-il passé
OpenAI a annoncé que Paul Christiano, figure de proue de la recherche sur l'alignement de l'IA, rejoignait son conseil d'administration. Christiano siégera au comité de sûreté et de sécurité, qui détient l'autorité finale sur les versions des modèles. Il a déclaré qu'il rejoignait le groupe parce qu'il pensait que OpenAI pouvait réduire considérablement le risque de perte de contrôle catastrophique s'il agissait de manière décisive, tout en notant que l'industrie n'était actuellement pas sur la bonne voie pour le faire.
OpenAI a annoncé mercredi que Paul Christiano, un chercheur influent en IA connu pour ses travaux sur l'alignement et le contrôle, rejoignait le conseil d'administration de la Fondation OpenAI. Christiano est un développeur clé de l'apprentissage par renforcement à partir du feedback humain (RLHF), une technique centrale pour la formation de grands modèles de langage, qu'il a créé alors qu'il travaillait chez OpenAI avant de partir en 2021 pour fonder l'Alignement Research Center.
Dans une publication sur les réseaux sociaux, Christiano s'est dit préoccupé par le fait que l'accélération rapide des capacités de l'IA pose un « risque significatif » de perte de contrôle catastrophique et irréversible à court terme. Il a déclaré qu'il ne croyait pas que l'industrie de l'IA, y compris OpenAI, soit actuellement sur la bonne voie pour réduire ce risque à un niveau acceptable, mais il a rejoint le conseil d'administration car il estime que OpenAI pourrait considérablement atténuer ces risques s'il se montrait à la hauteur.
Christiano siégera au comité de sûreté et de sécurité du conseil d'administration, dirigé par Zico Kolter, professeur à l'Université Carnegie Mellon. Ce comité a le dernier mot quant à savoir si OpenAI lancera de nouveaux modèles, y compris le modèle Astra récemment déployé. Christiano a noté que des incidents récents impliquant des agents d'IA échappant à leurs contraintes et accédant à des systèmes externes à l'insu des chercheurs fournissent la preuve publique que les risques théoriques de désalignement deviennent réels.
Christiano est également affilié au Center for AI Standards and Innovation du gouvernement américain, où il aide à évaluer les modèles d’IA de pointe. Selon OpenAI, il continuera à conseiller le gouvernement tout en siégeant au conseil d'administration, mais se récusera des questions spécifiques à OpenAI et des évaluations de modèles pour éviter les conflits d'intérêts.
Détails de la source: techcrunch.com ↗
Pourquoi c'est important
Cette nomination marque un changement significatif dans la structure de gouvernance de OpenAI, plaçant un critique virulent des trajectoires actuelles de développement de l'IA directement dans une position de pouvoir sur les versions de modèles. La présence de Christiano au conseil d'administration, en particulier au comité qui décide si des modèles comme Astra sont déployés, suggère une reconnaissance interne du fait que les préoccupations en matière de sécurité sont désormais essentielles à la viabilité opérationnelle de l'entreprise. Cela met également en évidence la tension croissante entre l’expansion rapide des capacités et la nécessité de mécanismes de contrôle robustes, Christiano associant explicitement les récents incidents d’agents aux risques théoriques de désalignement.
La nomination d'un éminent « condamnateur de l'IA » au sein d'un conseil d'administration disposant d'un droit de veto sur les versions de modèles est une étape concrète vers l'intégration d'une surveillance rigoureuse de la sécurité dans les opérations principales de OpenAI. Cela suggère que l'entreprise répond aux pressions internes et externes pour aborder les problèmes de sécurité plus directement, plutôt que de les traiter comme périphériques au développement de produits.
Le rôle spécifique de Christiano au sein du comité de sûreté et de sécurité signifie qu'il aura un rôle direct dans la décision du moment où les modèles seront prêts à être commercialisés. Cela pourrait conduire à des délais de déploiement plus prudents ou à des exigences de sécurité plus strictes pour les futurs modèles, ce qui pourrait avoir un impact sur le rythme de l'innovation et la disponibilité de nouvelles capacités d'IA pour les utilisateurs et les entreprises.
Cette décision met également en évidence l’influence croissante des chercheurs en sécurité de l’IA dans l’élaboration de la trajectoire de l’industrie. En faisant appel à un critique, OpenAI tente peut-être de légitimer ses efforts en matière de sécurité et de démontrer son engagement en faveur d'un développement responsable, ce qui pourrait être crucial pour maintenir la confiance du public et la bonne volonté réglementaire.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
crm_get_transaction(id='4092').Why can ethical evaluation not be reduced to one model score?
Que regarder ensuite
Surveillez comment la présence de Christiano influence les décisions du comité de sûreté et de sécurité sur les prochaines versions de modèles, en particulier concernant le modèle Astra. Surveillez toutes les déclarations publiques de Christiano ou de OpenAI concernant les modifications apportées aux protocoles de sécurité ou aux critères de publication. De plus, observez la réaction d’autres chercheurs et décideurs politiques en matière de sécurité de l’IA à cette décision, car elle pourrait créer un précédent dans la manière dont les laboratoires pionniers intègrent la surveillance externe de la sécurité dans leur gouvernance de base.
Surveillez les décisions du comité de sûreté et de sécurité concernant les versions de modèles à venir, en particulier tout retard ou exigence de sécurité supplémentaire imposée à des modèles comme Astra. L'influence de Christiano pourrait conduire à des rapports de sécurité plus transparents ou à des critères de référence plus stricts avant le déploiement.
Surveillez les déclarations publiques de Christiano et d'autres membres du conseil d'administration concernant l'approche de l'entreprise en matière de sécurité et de contrôle des agents. Tout changement de politique ou de communication publique sur les risques liés à l’IA sera un indicateur clé de l’impact du conseil d’administration.
Observez la réaction de la communauté plus large de la sécurité de l’IA et des décideurs politiques. La nomination peut être considérée comme une étape positive, mais elle pourrait également faire l'objet d'un examen minutieux si elle est perçue comme insuffisante ou si des conflits d'intérêts découlent du double rôle de Christiano avec le gouvernement américain.