IA constitucional
La IA constitucional es el método de Anthropic para alinear modelos utilizando un conjunto escrito de principios (una "constitución"), de modo que la IA critica y revisa sus propias respuestas en lugar de depender únicamente de los humanos para etiquetar el contenido dañino.
Descripción general
It aims to make models helpful and harmless with far less human labor.
Buceo profundo
La alineación tradicional se basa en el aprendizaje reforzado a partir de la retroalimentación humana (RLHF), donde las personas clasifican muchos resultados del modelo, incluidos los perturbadores, para enseñarle al modelo qué debe evitar. La IA constitucional reduce esa carga al darle al modelo una lista explícita de principios escritos extraídos de fuentes como la Declaración de Derechos Humanos de la ONU y las mejores prácticas de confianza y seguridad. La formación tiene dos etapas. Primero, una etapa supervisada: el modelo genera una respuesta, luego la critica contra un principio constitucional y la reescribe para mejorarla; estas respuestas de mejora personal se utilizan para perfeccionarlo. En segundo lugar, una etapa de aprendizaje por refuerzo, RLAIF, donde el modelo mismo clasifica pares de respuestas de acuerdo con la constitución, y los datos de preferencias generados por IA entrenan un modelo de recompensa. Los principios son transparentes y editables, lo que hace que los valores que rigen el modelo sean inspeccionables en lugar de estar ocultos dentro de etiquetas humanas opacas.
Información técnica
Las dos fases suelen denominarse SL-CAI y RL-CAI. En el aprendizaje supervisado, un ciclo de "crítica y revisión" incita al modelo a encontrar dónde su propia respuesta viola un principio muestreado y lo reescribe, generando datos de entrenamiento sin etiquetado de daños humanos. En la fase de RL, un segundo modelo juzga cuál de las dos respuestas sigue mejor la constitución, produciendo etiquetas de preferencia de IA (RLAIF) que entrenan un modelo de recompensa utilizado en RL estándar. La constitución es una guía en texto plano inyectada en indicaciones, por lo que cambiar el comportamiento del modelo puede ser tan directo como editar los principios.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro de la IA constitucional
La IA constitucional apunta hacia una "supervisión escalable", donde la IA ayuda a supervisar la IA a medida que los modelos se vuelven demasiado capaces para que los humanos controlen cada resultado. Espere constituciones más ricas y matizadas, aportes públicos y participativos sobre los cuales se eligen los principios (Anthropic ha realizado experimentos de 'IA constitucional colectiva') y enfoques híbridos que combinan la retroalimentación humana con la autocrítica de la IA. La transparencia de los principios escritos los hace atractivos para los reguladores y auditores que desean ver los valores que codifica un sistema. A medida que avancen los modelos de frontera, los métodos que permitan a los modelos criticarse y mejorarse de manera confiable frente a reglas explícitas probablemente se volverán fundamentales para la seguridad.
Implementación en el mundo real
Entrenar a un chatbot para que se niegue a ayudar a construir un arma haciendo que critique su propio borrador de respuesta según un principio de evitación de daños y lo reescriba.
Reemplazar el costoso etiquetado del equipo rojo humano de los productos tóxicos con datos de preferencia generados por IA (RLAIF) guiados por la constitución
Editar un principio escrito para ajustar qué tan cauteloso es un modelo y luego observar el cambio de comportamiento sin volver a etiquetar miles de ejemplos.
Realizar ejercicios de aportes colectivos donde el público propone principios que dan forma a la constitución del modelo.
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Ajuste de instrucciones
Preguntas frecuentes
What is Constitutional AI?
La IA constitucional es el método de Anthropic para alinear modelos utilizando un conjunto escrito de principios (una "constitución"), de modo que la IA critica y revisa sus propias respuestas en lugar de depender únicamente de los humanos para etiquetar el contenido dañino. Su objetivo es hacer modelos útiles e inofensivos con mucho menos trabajo humano.
¿Qué es la 'constitución' en la IA constitucional?
La constitución es un conjunto transparente de principios escritos, extraídos de fuentes como documentos de derechos humanos, que el modelo utiliza para evaluar y mejorar sus respuestas.
¿Qué problema clave con el RLHF estándar pretende reducir la IA constitucional?
Al hacer que el modelo se critique a sí mismo contra los principios, la IA constitucional reduce el trabajo humano de revisar y etiquetar resultados perturbadores o dañinos.
En la etapa supervisada de la IA constitucional, ¿qué hace el modelo con su propia producción?
El modelo ejecuta un ciclo de crítica y revisión: identifica dónde su borrador viola un principio muestreado y luego reescribe la respuesta, creando datos de entrenamiento automejorados.
¿Qué significa RLAIF en la etapa de aprendizaje por refuerzo?
RLAIF significa aprendizaje reforzado a partir de comentarios de IA: un modelo clasifica las respuestas según la constitución, produciendo datos de preferencias generados por IA en lugar de etiquetas humanas.
¿Por qué el uso de principios escritos se considera una ventaja para la transparencia?
Debido a que los valores guía están escritos, se pueden inspeccionar, auditar y editar directamente, a diferencia de las preferencias implícitamente codificadas en calificaciones humanas dispersas.