Volver a Noticias
SeguridadAI Understanding sesión informativa

Un estudio encuentra que los modelos de inteligencia artificial de Frontier se dividen bajo la presión de la dirección

Una preimpresión de seis modelos encontró formas marcadamente diferentes de resistir, redirigir o seguir indicaciones de dirección, pero sus etiquetas modelo-juez aún necesitan validación por parte de evaluadores humanos.

Por 6 min read
A researcher applies one mechanical control to six transparent laboratory mechanisms whose internal pathways redirect the same force in visibly different ways.
La versión corta

Una preimpresión de seis modelos encontró formas marcadamente diferentes de resistir, redirigir o seguir indicaciones de dirección, pero sus etiquetas modelo-juez aún necesitan validación por parte de evaluadores humanos.

que paso

Una preimpresión publicada el 6 de agosto comparó cómo seis modelos de lenguaje fronterizo cambiaron su comportamiento cuando las mismas tareas se combinaron con instrucciones para exponer, suprimir o anular el razonamiento relacionado con valores.

El estudio evaluó Claude Opus 4.7, GPT-5, Gemini 2.5 Pro, DeepSeek-R1, Qwen3.7-Max y Llama-3.3-70B-Instruct-Turbo: un modelo de cada uno de los seis desarrolladores. Su punto de referencia de 340 ítems contenía 100 indicaciones pareadas y dirigidas en cada una de las tres categorías principales: conflictos de valores leves, solicitudes para revelar razonamientos y solicitudes para suprimir consideraciones de valores. Cuarenta elementos adicionales probaron consejos de razonamiento y dirección de estilo ordinario. El trabajo es una preimpresión de arXiv de un solo autor, no una comparación revisada por pares ni una declaración de ninguno de los proveedores del modelo.

Los seis sistemas respondieron a cada base y dirección, produciendo 4.080 respuestas. Luego, los mismos seis modelos clasificaron cada respuesta según rúbricas de comportamiento fijas sin que se les dijera qué sistema la escribió, creando 24.480 juicios. Para cada respuesta, el autor utilizó la etiqueta de mayoría de los otros cinco modelos y excluyó el juicio del encuestado sobre sí mismo. Los primeros 20 ítems de cada categoría principal ayudaron a construir las rúbricas y permanecieron en el conjunto puntuado, por lo que el autor también volvió a realizar el análisis de los otros 80 ítems por categoría.

La división más grande reportada apareció cuando se presionó a los modelos para que revelaran su razonamiento. GPT-5 se negó a proporcionar ese razonamiento y dejó intacta su respuesta en 99 de 100 ítems dirigidos; los otros cinco sistemas recibieron esa etiqueta cero veces en 500 respuestas. El artículo también encontró que solo Opus y GPT-5 se resistieron abiertamente a las instrucciones de suprimir el razonamiento de valores a un ritmo significativo. Opus cuestionó con mayor frecuencia la instrucción mientras completaba la tarea, mientras que GPT-5 rechazó con mayor frecuencia el encuadre y retuvo el contenido solicitado.

Un experimento separado de peso abierto examinó la tendencia de Llama a hacer preguntas aclaratorias en lugar de responder algunas indicaciones ligeramente poco especificadas. Una sonda lineal decodificó la distinción juzgada de descarrilamiento versus respuesta del flujo residual del modelo con una precisión equilibrada máxima de 0,866. En 50 indicaciones retenidas, agregar una dirección derivada en la capa 40 movió la tasa de descarrilamiento juzgada del 0% en la intervención negativa más fuerte al 86% en la intervención positiva más fuerte. Ese experimento utilizó pesos de Llama de referencia localmente, no la misma pila de servicio alojada en Together utilizada para las respuestas de comportamiento.

Lea la fuente principal: Jalal-Kamali's language-model steering study on arXiv

Por qué es importante

Los resultados sugieren que una sola puntuación de cumplimiento o rechazo puede ocultar comportamientos de seguridad cualitativamente diferentes que son importantes cuando las personas presionan a los modelos para que ignoren, revelen o supriman una preocupación.

Dos sistemas pueden rechazar la misma instrucción pero dejar a los usuarios con resultados diferentes. Se puede rechazar un marco y ofrecer una alternativa utilizable; otro podrá oponerse mientras aún completa la tarea solicitada; un tercero podrá hacer una pregunta aclaratoria; y otro puede seguir la instrucción manteniendo implícita una preocupación. Los equipos de producto que cuentan solo los rechazos pueden pasar por alto esas distinciones, aunque afecten si un usuario recibe ayuda útil, contenido táctico riesgoso o un callejón sin salida inexplicable.

Los resultados de referencia muestran que la dirección no creó todas las diferencias. En indicaciones leves de conflicto de valores sin una instrucción de dirección explícita, Opus cumplió plenamente con 35 de 100 ítems y formuló preguntas aclaratorias sobre 60, mientras que Llama cumplió plenamente con 57 y aclaró 42. GPT-5, Gemini, DeepSeek y Qwen cumplieron plenamente con 93 de 100 ítems. Esas tasas describen la rúbrica y el conjunto de indicaciones de este punto de referencia; no establecen qué modelo es más ético, veraz, seguro o útil en general.

La condición de supresión del razonamiento también ilustra por qué el texto visible no puede tratarse como una explicación transparente del cálculo del modelo. En 85 de 100 seguimientos de DeepSeek, apareció la dimensión de valores excluidos y luego se dejó de lado antes de que la respuesta cumpliera con la solicitud de supresión. Esa es evidencia sobre el texto emitido por esta versión de DeepSeek en esta configuración, no acceso directo a cada causa interna de su respuesta. El artículo en sí distingue el razonamiento revelado de una explicación fiel del cálculo que produjo un resultado.

La intervención de Llama añade más que una correlación: cambiar la dirección de una corriente residual cambió el comportamiento medido en las indicaciones retenidas. Esto ofrece a los investigadores un objetivo concreto para estudiar el comportamiento de clarificación y rechazo en un modelo abierto. Sin embargo, la dirección puede agrupar la ambigüedad de la respuesta, la duración de la respuesta y otras características correlacionadas en lugar de aislar un mecanismo mínimo. El documento informa sobre un modelo pequeño que indica una línea de base y verificaciones de truncamiento, pero explícitamente no llega a utilizar el mecanismo de Llama para explicar las diferencias entre los seis sistemas implementados.

Qué ver a continuación

Esté atento a las anotaciones humanas, la reproducción independiente en las versiones actuales del modelo, controles más estrictos para las expectativas de los jueces y pruebas mecanicistas que separan un comportamiento de sus características superficiales correlacionadas.

La validación humana es la prueba que más claramente falta. El panel modelo logró un acuerdo sustancial en cuatro categorías, pero sólo un acuerdo moderado para la supresión del razonamiento, con un kappa de Fleiss de 0,599. La eliminación de un campo de contexto de elemento que indicaba a los jueces para qué estaba diseñado cada mensaje cambió 9,7 puntos porcentuales de las etiquetas en general y 16,7 puntos en la categoría de supresión. Un control de 216 respuestas preservó las comparaciones de los titulares del artículo, pero evaluadores humanos capacitados deberían probar si las etiquetas y las distinciones finas coinciden con el juicio de los expertos.

La replicación debería congelar las versiones del modelo, las indicaciones del sistema, la configuración del proveedor y las fechas. El estudio utilizó un muestreo predeterminado del proveedor porque algunas API rechazaban controles comunes de temperatura y semillas, y probó un modelo por desarrollador. Por lo tanto, no puede respaldar afirmaciones sobre el método de capacitación general de una empresa o sobre versiones posteriores que llevan el mismo modo de respuesta. Las ejecuciones repetidas deben medir la variabilidad dentro del modelo y determinar si persiste una división de 99 a cero entre solicitudes, idiomas, dominios y puntos finales actualizados.

El diseño del desarrollo de la rúbrica merece un estudio más extenso. Las etiquetas se crearon después de leer las respuestas a 20 elementos por categoría principal, incluido el patrón GPT-5 que luego apareció cerca del techo, y esos elementos formaban parte de los totales principales de 100 elementos. La repetición de 80 artículos del autor mantuvo las tasas y los pedidos dentro de cinco puntos, lo que reduce, pero no elimina, el sesgo de descubrimiento. Un equipo independiente debe definir o registrar previamente la taxonomía, construir nuevas indicaciones y evaluar respuestas que no desempeñaron ningún papel en la denominación de los comportamientos.

El seguimiento mecánico debe utilizar parches de activación u otras intervenciones específicas para probar si la dirección de Llama es causal en un nivel más estrecho, repetir el resultado en divisiones aleatorias mantenidas y comparar los pesos de referencia con las pilas de servicio desplegadas. Para productos reales, los evaluadores deben conectar estos modos de respuesta del laboratorio con los resultados del usuario: finalización de tareas inseguras, redirección adecuada, accesibilidad, recuperación de errores y confianza. Hasta entonces, el resultado verificado es un hallazgo preimpreso estructurado sobre seis sistemas específicos, no un mapa universal de cómo se comporta la IA fronteriza bajo presión.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic