GUÍA de IA en idiomas

Ajuste de prefijo

El ajuste de prefijos es una forma eficiente de adaptar un modelo de lenguaje congelado entrenando un pequeño conjunto de vectores continuos que se anteponen a la entrada de cada capa.

2 minutos de lecturaÚltima actualización

Descripción general

It lets you customize giant models for new tasks while updating less than 1% of parameters.

Buceo profundo

La sintonización de prefijos, introducida por los investigadores de Stanford Li y Liang en 2021, adapta un transformador previamente entrenado sin tocar sus pesos. En lugar de ajustar todos los parámetros, antepone una secuencia de 'tokens virtuales' entrenables (el prefijo) a las claves y valores en cada capa de atención. El modelo congelado atiende a este prefijo como si fuera un contexto real, dirigiendo su comportamiento hacia una tarea objetivo. Debido a que solo se aprenden los vectores de prefijo, puede almacenar un pequeño prefijo por tarea en lugar de una copia completa del modelo. Esto hace que realizar muchas tareas sea barato y evita la explosión del almacenamiento que implica un ajuste completo. Funciona especialmente bien en tareas de generación como tabla a texto y resumen, y a menudo coincide con un ajuste completo en configuraciones con gran cantidad de datos.

Información técnica

A diferencia del ajuste rápido, que solo agrega vectores en la capa de incrustación de entrada, el ajuste de prefijo inyecta vectores clave/valor entrenables en la autoatención de cada capa del transformador. Para estabilizar el entrenamiento, el prefijo generalmente se genera mediante una pequeña red de retroalimentación (un truco de reparametrización) en lugar de optimizarse directamente; esa red se descarta después del entrenamiento, dejando solo las matrices de prefijos aprendidas. Sólo estos parámetros de prefijo reciben gradientes: toda la red troncal permanece congelada.

Impacto Estratégico

Speed and scale

Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.

Access and reach

Amplía el acceso a través de idiomas y estilos de comunicación.

Decisiones más claras

Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.

El futuro del ajuste de prefijos

El ajuste de prefijo ayudó a lanzar la onda de ajuste fino eficiente en parámetros (PEFT) y sigue siendo un componente básico en bibliotecas como Hugging Face PEFT. A medida que los modelos básicos crecen hasta alcanzar los cientos de miles de millones de parámetros, los adaptadores livianos, como los prefijos, son cada vez más atractivos para el servicio multiinquilino y la personalización en el dispositivo. Espere enfoques híbridos continuos que combinen prefijos con actualizaciones de bajo rango estilo LoRA y un uso creciente para controlar el estilo, la personalidad y el comportamiento de seguridad sin volver a entrenar modelos completos.

Implementación en el mundo real

Adaptación de una columna vertebral GPT-2 congelada para la generación de tabla a texto entrenando un pequeño prefijo en el conjunto de datos WebNLG

Ofrece docenas de estilos de resumen específicos del cliente desde un único modelo compartido, cada uno como un archivo de prefijo intercambiable.

Dirigir el tono o la personalidad de un modelo de lenguaje para un chatbot sin volver a entrenar los pesos base

Adaptación de dominios con pocos datos, como la generación de textos legales o médicos, donde un ajuste completo sería excesivo

Riesgos y barandillas

Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.

La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.

Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.

Hoja de ruta de implementación

1

Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.

2

Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.

3

Mantenga un punto de control de revisión humana para los resultados de alto riesgo.

4

Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Prefix Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Ajuste fino del muestreo de rechazo

Preguntas frecuentes

What is Prefix Tuning?

El ajuste de prefijos es una forma eficiente de adaptar un modelo de lenguaje congelado entrenando un pequeño conjunto de vectores continuos que se anteponen a la entrada de cada capa. Le permite personalizar modelos gigantes para nuevas tareas mientras actualiza menos del 1% de los parámetros.

¿Qué entrena realmente la sintonización de prefijos?

El ajuste de prefijos congela la red troncal y aprende solo un pequeño conjunto de vectores de prefijos continuos, lo que lo mantiene eficiente en cuanto a parámetros.

¿Dónde se inyectan los vectores de prefijo?

El ajuste de prefijo antepone vectores clave/valor entrenables en la autoatención de cada capa del transformador, no solo en la entrada.

¿Quién introdujo el ajuste de prefijos y aproximadamente cuándo?

El ajuste de prefijo fue propuesto por Xiang Lisa Li y Percy Liang en Stanford en 2021.

¿Por qué el ajuste de prefijos es atractivo para muchas tareas?

Debido a que sólo el prefijo pequeño es específico de la tarea, se almacena un archivo pequeño por tarea en lugar de duplicar todo el modelo.

¿Qué truco se utiliza a menudo para estabilizar el entrenamiento de prefijos?

Un MLP pequeño genera el prefijo durante el entrenamiento para lograr estabilidad, luego se desecha, dejando solo las matrices de prefijos aprendidas.