Volver a Noticias
SeguridadAI Understanding sesión informativa

ProbGuard señala riesgo de jailbreak dentro de 10 tokens LLM

Una nueva preimpresión estima si la respuesta de un modelo inacabado se volverá insegura al leer sus distribuciones de probabilidad tempranas, pero la evidencia se limita a tres familias de modelos abiertos y ataques de referencia.

Por 6 min read
A red probability path stops at a transparent safety monitor while many blue-white model-generation paths continue through it.
La versión corta

Una nueva preimpresión estima si la respuesta de un modelo inacabado se volverá insegura al leer sus distribuciones de probabilidad tempranas, pero la evidencia se limita a tres familias de modelos abiertos y ataques de referencia.

que paso

Los investigadores presentaron ProbGuard en una preimpresión del 11 de agosto como una medida de seguridad que estima la probabilidad de que una respuesta de modelo de lenguaje inacabado se vuelva insegura, utilizando distribuciones de salida de tan solo los primeros 10 pasos de decodificación.

La mayoría de las barreras de seguridad clasifican el texto que un modelo ya ha producido. En cambio, ProbGuard observa las probabilidades asignadas a los próximos tokens probables mientras la generación aún está comenzando. En cada paso, el sistema retiene las 50 probabilidades de token principales, convierte candidatos específicos del tokenizador en un espacio de incrustación compartido y pondera esas representaciones según la probabilidad. Los autores describen el diseño como independiente de la arquitectura porque no lee los estados ocultos del modelo protegido, aunque la implementación aún requiere acceso a probabilidades de salida a nivel de token que muchas API de modelos cerrados no exponen.

Los objetivos de formación provienen de futuros posibles y no de una única respuesta completa. Para cada estado de primera generación, los investigadores tomaron muestras de 16 continuaciones de hasta 512 tokens a una temperatura de 1,0 y utilizaron un clasificador separado, CalibEval, para etiquetar cada continuación como segura o insegura. La fracción etiquetada como insegura se convirtió en el riesgo estimado para ese prefijo. Luego, ProbGuard fue entrenado posteriormente para predecir esa probabilidad directamente a partir del mensaje original y la representación ponderada de probabilidad del prefijo.

La evaluación utilizó Llama 3 8B Instruct, Qwen3-8B y Gemma 2 9B Instruct como modelos protegidos. La capacitación combinó 3000 indicaciones dañinas deduplicadas de PKU, WildGuard y SEval; La evaluación utilizó 1.000 indicaciones retenidas de cada conjunto de datos. Los autores compararon ProbGuard con 13 líneas de base de confianza, barrera de seguridad, monitor de transmisión y sonda de activación, midiendo la calibración con la puntuación de Brier y el error de calibración esperado en nueve combinaciones de modelo y conjunto de datos.

Con un prefijo de 10 tokens, el artículo informa que la variante ProbGuard de 8 mil millones de parámetros tuvo la mejor puntuación Brier y el error de calibración esperado en cada emparejamiento de modelo-conjunto de datos reportado. En promedio con respecto a la línea de base más sólida en cada entorno, los autores calculan reducciones del 79,6 % en la puntuación de Brier y del 71,9 % en el error de calibración esperado. Estos son los resultados de referencia del equipo de investigación de una nueva preimpresión no revisada por pares; ningún grupo independiente los ha reproducido todavía.

Lea la fuente principal: ProbGuard research paper on arXiv

Por qué es importante

Una alerta temprana bien calibrada podría detener la producción dañina antes de que aparezca, y al mismo tiempo otorgar a los operadores una puntuación de riesgo en lugar de forzar cada respuesta incompleta a una etiqueta prematura de segura o insegura.

La distinción práctica es el tiempo. Un filtro de posgeneración puede ocultar o reemplazar una respuesta insegura completa, pero el modelo subyacente ya ha dedicado tiempo y cálculo a producirla, y las aplicaciones de transmisión pueden exponer parte de ella antes de una verificación final. ProbGuard está diseñado para intervenir después de sólo un pequeño prefijo. En las pruebas de ataque del documento, el monitor 8B limitó el éxito promedio del ataque al 0,83% en AdvBench y al 0,67% en HarmBench después de 10 pasos de decodificación, en comparación con el 53,83% y el 37,83% cuando no se utilizó ninguna defensa.

La calibración es importante porque una puntuación de 0,8 debería corresponder a resultados inseguros con más frecuencia que una puntuación de 0,2. Luego, los operadores pueden elegir umbrales para diferentes contextos en lugar de tratar el texto inicial ambiguo como seguro. El documento informa una tasa promedio combinada de éxito de ataque del 0,75% para ProbGuard-8B y del 1,00% para su versión 4B; su versión 0.6B promedió 2,83%. El monitor más pequeño procesó 1.000 muestras en 12,8 segundos y utilizó 3,32 GB de memoria GPU en la configuración de los autores, lo que sugiere una posible compensación entre velocidad y costo en lugar de un tamaño de monitor requerido.

El enfoque también prueba un término medio útil entre los filtros de solo texto y las sondas internas del modelo. Los monitores de estado oculto pueden capturar señales internas, pero a menudo necesitan acceso personalizado y reentrenamiento para cada arquitectura. ProbGuard retokeniza las salidas candidatas en su propia representación, por lo que se evaluó un monitor en tres tokenizadores y familias de modelos diferentes. Esto podría facilitar la integración para las organizaciones que albergan modelos abiertos, siempre que su pila de inferencia pueda exponer probabilidades de registro confiables en cada paso de decodificación.

El beneficio público depende de los falsos positivos y de los ataques bloqueados. Un monitor demasiado sensible puede interrumpir una discusión benigna sobre medicina, seguridad, historia o políticas, haciendo que un servicio sea menos útil y potencialmente afectando algunos idiomas o comunidades de manera desigual. Los resultados de la calibración de ProbGuard son alentadores para los conjuntos de datos de seguridad seleccionados en inglés, pero el documento no establece el rendimiento en el tráfico de producción ordinario, conversaciones multilingües, tareas largas e benignas o dominios especializados donde se superponen lenguajes dañinos y legítimos.

Qué ver a continuación

La puerta de lanzamiento es una replicación independiente en modelos más nuevos y cerrados, tráfico realista, datos multilingües, ataques adaptativos e informes transparentes de bloqueos falsos, latencia y requisitos de acceso.

La limitación más fuerte es el alcance. Los modelos protegidos son tres sistemas de peso abierto en el rango aproximado de 8B a 9B, no los modelos alojados a escala fronteriza actuales. Las seis técnicas de jailbreak se evaluaron contra Qwen3-8B utilizando 100 mensajes dañinos de AdvBench y 100 de HarmBench. Los umbrales operativos se seleccionaron maximizando F1 en una división de PKU retenida, y GPT-5 juzgó las respuestas de ataque resultantes. Los resultados pueden cambiar con diferentes jueces, umbrales, configuraciones de muestreo, escalas de modelos, distribuciones rápidas o ataques optimizados específicamente contra ProbGuard.

La señal de entrenamiento se estima en lugar de la verdad observada en el terreno. Dieciséis continuaciones muestreadas produjeron una tasa de cambio de decisión del 3,6% en comparación con una referencia de 128 muestras en el análisis de los autores, y CalibEval determinó qué continuaciones se consideraban inseguras. El artículo informa que CalibEval alcanzó 0,943 F1 en el conjunto de evaluación de PKU, pero cualquier error sistemático en ese criterio puede propagarse a las probabilidades objetivo de ProbGuard. La revisión humana y el etiquetado de seguridad independiente ayudarían a probar si las puntuaciones resultantes reflejan daños en el mundo real en lugar de los límites de un clasificador.

El acceso y el costo necesitan mediciones de producción. Las API alojadas normalmente devuelven solo texto generado o datos de probabilidad de registro limitada, mientras que ProbGuard espera las 50 probabilidades principales en cada paso. Los operadores autohospedados pueden exponer esas distribuciones, pero deben ejecutar un monitor adicional durante la generación y decidir cómo manejar las pausas, los cruces de umbrales y las respuestas alternativas. Las cifras de latencia del documento provienen del hardware NVIDIA RTX Pro 6000 con 256 GB de memoria del sistema y no informan la latencia del usuario de un extremo a otro bajo carga simultánea.

Finalmente, los investigadores deberían probar el comportamiento adaptativo. Un atacante que sabe que el monitor lee las primeras distribuciones de probabilidad puede intentar mantener los primeros tokens benignos, distribuir el riesgo entre candidatos de baja probabilidad o generar falsos positivos para degradar el servicio. La evidencia de seguimiento útil incluiría códigos y ponderaciones públicos, evaluaciones prerregistradas, pruebas multilingües y multimodales, intentos de equipo rojo dirigidos directamente al monitor y auditorías de quién está bloqueado desproporcionadamente. Hasta entonces, ProbGuard es un prototipo de investigación prometedor, no una prueba de que se hayan resuelto los jailbreaks.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic