Volver a Noticias
SeguridadAI Understanding sesión informativa

Un estudio encuentra que los puntos de referencia de seguridad de la IA pueden utilizar muchas menos pruebas

Una preimpresión afiliada al Instituto de Seguridad de IA del Reino Unido reprodujo varios resultados de referencia de seguridad con entre un 97% y un 99% menos de indicaciones, al tiempo que advirtió que las pruebas más breves no demuestran la seguridad en el mundo real.

Por 4 min read
A measurement scientist selects a few geometric test pieces from a large tray while three calibration chambers and a comparison station audit machine responses.
La versión corta

Una preimpresión afiliada al Instituto de Seguridad de IA del Reino Unido reprodujo varios resultados de referencia de seguridad con entre un 97% y un 99% menos de indicaciones, al tiempo que advirtió que las pruebas más breves no demuestran la seguridad en el mundo real.

que paso

Un artículo de investigación publicado el 5 de agosto aplica un método de pruebas educativas para medir lo que capturan los puntos de referencia de seguridad de la IA, seleccionar conjuntos más pequeños de indicaciones útiles y auditar los cambios en el comportamiento del modelo.

Dos investigadores independientes y dos investigadores afiliados al Instituto de Seguridad de IA del Reino Unido evaluaron 192 modelos de chat en ocho puntos de referencia que cubrían el rechazo de solicitudes dañinas, el rechazo excesivo de solicitudes benignas, el daño contextual y la veracidad. El conjunto completo contenía 5255 mensajes antes del preprocesamiento; el análisis retuvo 5.067 después de eliminar las respuestas sin puntuación y los ítems que no distinguían entre los modelos probados.

El equipo trató a los modelos como examinados y a las indicaciones de referencia como elementos de prueba, utilizando la teoría de respuesta al ítem para estimar qué indicaciones eran difíciles y cuáles separaban mejor los modelos. En su análisis factorial principal, una solución de tres factores (resumida en rigor del rechazo, veracidad y daño contextual) explicó el 77% de la variación en las habilidades del modelo, en comparación con el 47% de un solo factor.

En 20 evaluaciones realizadas, tres pruebas fijas de 25 indicaciones recuperaron esos tres factores utilizando menos del 2% del conjunto. Para HarmBench, SORRY-Bench y OR-Bench-Hard, aproximadamente 10 indicaciones elegidas de forma adaptativa reprodujeron clasificaciones de referencia completas con correlaciones de 0,92 a 0,94 y redujeron el número de indicaciones entre un 97% y un 99%; la ventaja se redujo a medida que crecía el presupuesto de prueba.

Lea la fuente principal: Rivera and colleagues' research paper on arXiv

Por qué es importante

El estudio sugiere que unas indicaciones mejor seleccionadas podrían abaratar los controles frecuentes de seguridad de la IA sin pretender que cada punto de referencia mida una puntuación de seguridad universal.

Pruebas más económicas podrían permitir a los desarrolladores, pequeños laboratorios y evaluadores independientes verificar más versiones de modelos durante el entrenamiento, el ajuste, la cuantificación y los cambios en las indicaciones del sistema. El resultado consiste en reproducir eficientemente las mediciones de referencia existentes, no en ampliar lo que esos puntos de referencia pueden detectar.

El análisis factorial también expone una compensación en la puntuación. Los puntos de referencia que recompensan el rechazo pueden superponerse entre sí, mientras que un punto de referencia para evitar rechazos innecesarios recompensa el comportamiento opuesto. Promediarlos sin explicar las ponderaciones puede ocultar si un modelo se volvió más seguro, simplemente más restrictivo o menos útil en solicitudes benignas.

El documento también probó métodos de auditoría de caja negra en comportamientos de sacos de arena provocados deliberadamente. Una verificación del patrón de respuesta detectó un desempeño deficiente selectivo, pero no detectó el desempeño deficiente más uniforme; agregar una verificación de capacidad histórica elevó la detección combinada al 94%-97% en los casos simulados. Esto respalda auditorías por niveles en lugar de depender de una sola puntuación.

Qué ver a continuación

Esté atento a la replicación independiente, la validación de futuras familias de modelos y la evidencia de que las pruebas abreviadas predicen comportamientos fuera de los puntos de referencia para los que fueron diseñadas.

Esta es una nueva preimpresión, no un veredicto completo de revisión por pares. El análisis de estructura latente utilizó 134 modelos, que según los autores es pequeño según los estándares psicométricos convencionales, y un método de extracción alternativo retuvo dos factores en lugar de tres. Los nombres de los factores son resúmenes empíricos, no definiciones validadas de seguridad.

Cada modelo produjo una respuesta por mensaje disponible a través de OpenRouter, y cada punto de referencia utilizó su juez automatizado prescrito. Las pruebas breves resultantes pueden heredar fallas en las indicaciones originales, las reglas de puntuación, la cobertura del idioma y los jueces; Los autores dicen explícitamente que la compresión no muestra que un punto de referencia prediga la seguridad de la implementación o siga siendo informativo para modelos futuros.

Las pruebas de sacos de arena utilizadas provocaron organismos modelo en lugar de modelos ajustados para evadir la evaluación, que pueden ser más fáciles de detectar. Las comprobaciones de API establecen la continuidad del comportamiento, no la identidad de los pesos ocultos del modelo, y el estudio no probó a un adversario específicamente entrenado para derrotar los métodos de auditoría.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic