Volver a Noticias
InnovaciónAI Understanding sesión informativa

Un artículo encuentra que las últimas capas de un modelo de mezcla de expertos toleran un enmascaramiento intenso de expertos

Una preimpresión informa que al desactivar expertos de baja magnitud en las últimas cinco capas de un modelo de Mezcla de Expertos de 35 mil millones de parámetros se conservaron resultados de traducción de códigos mucho más utilizables que distribuir los mismos cortes en todas las capas. Cubre un modelo y un punto de referencia, y el resumen no informa ninguna línea de base desenmascarada.

Por 7 min read
A row of rack-mounted GPU servers in a data centre cold aisle at night, with bundled fibre cables and small status lights along the perforated cabinet doors.
La versión corta

Una preimpresión informa que al desactivar expertos de baja magnitud en las últimas cinco capas de un modelo de Mezcla de Expertos de 35 mil millones de parámetros se conservaron resultados de traducción de códigos mucho más utilizables que distribuir los mismos cortes en todas las capas. Cubre un modelo y un punto de referencia, y el resumen no informa ninguna línea de base desenmascarada.

que paso

Tres investigadores publicaron una preimpresión de arXiv informando un estudio de sensibilidad capa por capa de un modelo de Mezcla de Expertos de 35 mil millones de parámetros, deshabilitando expertos de baja magnitud y midiendo la calidad de salida en un punto de referencia de traducción de código multilingüe. Informan que las capas tempranas y medias se degradan drásticamente bajo el uso de mascarillas, mientras que las últimas cinco capas toleran que la mitad de sus expertos estén apagados.

Una preimpresión publicada en arXiv (arXiv:2608.13565, incluida en Inteligencia artificial y enviada el 25 de junio de 2026) por Pradeep Kumar Sharma, Shantanu Godbole y Hritvik Shrivastava informa sobre un análisis de sensibilidad sistemático por capas de un modelo de lenguaje de mezcla de expertos. El objetivo declarado del artículo es Qwen3.6-35B-A3B, que el resumen describe como que tiene 40 capas de Mezcla de Expertos, 256 expertos por capa y enrutamiento de los 8 principales: 10,240 expertos en total, de los cuales ocho se activan por token por capa. La tarea de evaluación es XLCoST, un punto de referencia de traducción de código multilingüe. Según el resumen, los experimentos se realizaron a escalas de 100, 300 y 500 mensajes en tres servidores GPU H100.

La técnica se describe como enmascaramiento de expertos basado en la magnitud: los expertos se clasifican según la magnitud del peso y los que tienen la clasificación más baja dentro de un conjunto elegido de capas se desactivan, de modo que el enrutamiento ya no pueda seleccionarlos. El resumen enumera la "cirugía de peso físico" como trabajo futuro, lo que indica que los expertos enmascarados fueron desactivados en lugar de eliminados de la memoria en estos experimentos. Los autores comparan una política plana (que enmascara la misma fracción en cada capa) con políticas dirigidas a profundidad que concentran el enmascaramiento en capas posteriores.

Las cifras de los titulares reportadas en el resumen son comparativas. El enmascaramiento plano del 30 por ciento de los expertos en todas las capas retuvo 150 de 300 resultados calificados como "Bueno+Similar" en la escala de 300 puntos. Las políticas centradas tardíamente retuvieron entre 249 y 255 de 300, al tiempo que enmascararon a entre 640 y 1.145 expertos. En una porción de validación posterior de 500 solicitudes, la política más estrecha probada (capas 35 a 39 con un enmascaramiento del 50 por ciento) retuvo 419 de 500 resultados Bueno+Similar mientras enmascaraba a 640 de los 10,240 expertos totales, aproximadamente el 6 por ciento de los expertos del modelo. Los autores caracterizan las capas tempranas (0-9) y las capas intermedias (10-29) como muy frágiles y las capas muy tardías (35-39) como las más tolerantes.

El documento también informa sobre una palanca separada: reducir el ancho de ruta de ocho expertos activos por token a seis. En una prueba de 100 preguntas, el resumen describe una "gran reducción observada en el reloj de pared" sin pérdida de resultados Bueno+Similar, pero afirma claramente que este cambio "aún no se compone claramente con un enmascaramiento experto agresivo"; es decir, los dos ahorros simplemente no se suman.

Varias cosas no están establecidas por el material disponible. Esta evaluación se basa en el resumen y la página de listado de arXiv, no en el PDF completo. El resumen no informa la puntuación inicial desenmascarada, por lo que no se puede determinar a partir de él la proporción del resultado de 419 de 500 atribuible al enmascaramiento; no define cómo se calificaron los productos como "buenos" o "similares", ni quién o qué; no cuantifica la reducción del reloj de pared; no informa ningún ahorro de memoria; y no menciona ninguna comparación con los métodos de poda existentes de una combinación de expertos. La lista no muestra ninguna indicación de revisión por pares o aceptación de la revista.

Lea la fuente principal: arxiv.org

Por qué es importante

Los modelos de combinación de expertos son la forma dominante de escalar modelos de lenguaje grandes de forma económica, pero hay poca orientación establecida sobre qué expertos se pueden eliminar. El hallazgo sugiere que el valor predeterminado intuitivo (podar cada capa al mismo ritmo) puede ser la peor opción con un presupuesto determinado, aunque el documento enmascara a los expertos en lugar de eliminarlos, por lo que los ahorros en hardware siguen sin comprobarse.

Las arquitecturas de combinación de expertos son ahora la forma estándar de agregar parámetros a un modelo de lenguaje grande sin un aumento proporcional en la computación por token: solo un pequeño subconjunto de expertos activa para cada token. Ese diseño se ha extendido rápidamente entre los modelos comerciales y de peso abierto, pero cambia el problema de la compresión. La investigación de poda clásica se centra en redes densas donde cada peso participa en cada pase hacia adelante. En un modelo disperso, la cuestión no es sólo cuánto cortar sino dónde, y el campo tiene comparativamente poca orientación publicada sobre qué expertos y en qué capas realmente soportan la carga.

La afirmación práctica aquí es sobre esa asignación. La poda uniforme es el defecto obvio, y en este modelo y punto de referencia tuvo el peor desempeño: la política fija del 30 por ciento perdió aproximadamente la mitad de los productos utilizables, mientras que las políticas con objetivos profundos que enmascaraban un número comparable o mayor de expertos mantuvieron más del 80 por ciento. Si ese patrón se generaliza, es un cambio barato para cualquiera que comprima un modelo de Mezcla de Expertos: una elección diferente de qué capas tocar, no una nueva ejecución de entrenamiento o arquitectura. La asignación basada en profundidad también es fácil de probar con una canalización existente.

Los límites de ese impacto son reales y el artículo es sincero sobre uno de ellos. Enmascarar a un experto impide que se utilice; no libera la memoria que ocupan sus pesos. Para el servicio de mezcla de expertos, la memoria es a menudo la restricción vinculante precisamente porque todos los expertos deben ser residentes, aunque pocos disparen por token. Hasta que los pesos se retiren físicamente y se vuelvan a medir, el resultado informado es evidencia de redundancia, no una ganancia de eficiencia demostrada. Los autores consideran la cirugía de pesas como el siguiente paso y no como uno completo.

Para los lectores ajenos a la investigación, lo que está en juego es dónde se pueden ejecutar estos modelos. La compresión es una de las principales rutas por las cuales los modelos capaces llegan a hardware más pequeño (un único servidor, una implementación local, una computadora portátil) en lugar de un clúster alquilado. Pero el costo de la calidad importa: incluso en la configuración mejor informada, aproximadamente uno de cada seis productos quedó fuera de las categorías Bueno+Similar, y sin la línea de base desenmascarada no es posible decir qué parte de esa brecha causó el enmascaramiento. La traducción de código también es una tarea con una clara noción de corrección; Los resultados allí no se transfieren automáticamente a escritos o razonamientos abiertos.

El hallazgo de profundidad es direccionalmente consistente con una línea más amplia de trabajo de interpretabilidad que sugiere que las capas transformadoras posteriores tienen más redundancia que las primeras, que realizan un trabajo más pesado en la representación básica. La coherencia no es confirmación. Este es un modelo, una familia de referencia y un criterio de enmascaramiento, de una preimpresión cuya metodología completa no ha sido verificada de forma independiente.

Qué ver a continuación

El seguimiento decisivo es si el enmascaramiento se convierte en memoria real y ahorro de latencia una vez que se eliminan físicamente los pesos, y si el patrón de profundidad se mantiene en otras familias de Mezcla de Expertos y en tareas más allá de la traducción de código. También vale la pena observar: divulgación de la línea base desenmascarada y del método de calificación, publicación del código y cualquier revisión por pares.

La prueba más clara es si el enmascaramiento sobrevive al contacto con el hardware. Los autores mencionan la cirugía de peso físico como el siguiente paso; un seguimiento que elimine a los 640 expertos identificados e informe la huella de memoria, el rendimiento y la latencia medidos convertiría un reclamo de redundancia en un reclamo de eficiencia. Si la eliminación produce poco ahorro (debido a cómo se distribuyen o fragmentan los pesos expertos), el caso práctico se debilita considerablemente aunque se mantenga el hallazgo de sensibilidad.

La generalización es la segunda cuestión. El estudio cubre un único modelo de combinación de expertos con 256 expertos por capa y enrutamiento entre los 8 principales. Aquí no se ha probado si aparece el mismo gradiente de profundidad en modelos con diferentes recuentos de expertos, anchos de enrutamiento, diseños de expertos compartidos o recetas de capacitación. También lo es la cobertura de tareas: la traducción de código es una familia de referencia, y el enmascaramiento que deja intacta la salida del código aún puede dañar el rendimiento multilingüe, el comportamiento de contexto largo o el razonamiento de varios pasos.

La divulgación metodológica es importante para interpretar las cifras. Esté atento a la línea de base desenmascarada, una definición precisa de las calificaciones Bueno y Similar y quién o qué las asignó, el tamaño de la reducción del reloj de pared debido a la ruta cada vez más estrecha y si la selección basada en la magnitud supera al experto basado en la activación que califica la lista de los autores como trabajo futuro. La publicación del código y las configuraciones de enmascaramiento permitirían a otros replicar la comparación directamente.

Vale la pena seguir por sí solo el problema de composición de las banderas abstractas. La reducción del ancho de enrutamiento y el enmascaramiento experto son diferentes mecanismos de ahorro, y el documento informa que aún no se acumulan claramente. Un método que los combine sin agravar la pérdida de calidad tendría más consecuencias que cualquiera de los dos por separado; un hallazgo de que interfieren fundamentalmente sería un resultado negativo igualmente útil.

Por último, una laguna que no se ha abordado: el estudio mide la calidad de los resultados en un punto de referencia del código y no dice nada sobre el comportamiento relevante para la seguridad. La compresión cambia lo que hace un modelo, y no se aborda si el enmascaramiento dirigido a la profundidad afecta los rechazos, la calibración o la susceptibilidad a los jailbreaks. Cualquiera que implemente un modelo enmascarado necesitaría que se evalúe por separado, y el trabajo de seguimiento que lo informe sería una adición significativa.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe mensual

Obtenga las historias de IA que realmente importan.

Un breve correo electrónico al mes: qué cambió en la IA, por qué es importante, además de las herramientas y guías que valen la pena.

Gratis · Sin spam · Darse de baja en un clic