Volver a Noticias
InnovaciónAI Understanding sesión informativa

Un nuevo punto de referencia muestra que la rúbrica del examen de Vietnam puede cambiar la clasificación de los modelos lingüísticos

Un artículo presenta THPT-Ladder, un punto de referencia de 632 ítems que aplica el esquema de calificación del examen nacional de Vietnam de 2025 a modelos lingüísticos e informa puntuaciones materialmente diferentes de las medidas estándar de precisión proporcional.

6 min readRead the primary source
Source-page capture accompanying New benchmark shows Vietnam’s exam rubric can change how language models rank
Documento de fuente primariaFuente registrada
Editor
arxiv.org
Enlace fuente
arxiv.orghttps://arxiv.org/abs/2608.18336
Tipo de fuente
Documento principal: un anuncio oficial, documento, archivo o página propia que leemos directamente.
ContextoEntiende esto en 60 segundos

Empieza aquí

Términos clave

Punto de referencia
Una prueba o conjunto de datos estandarizado que se utiliza para medir y comparar el rendimiento del modelo.
Normalización
Transformar valores a una escala consistente para mejorar la estabilidad de la optimización.
Robustez
La capacidad de un modelo para mantener el rendimiento bajo ruido, cambios o entradas adversas.
Ponte a pruebaModelos de IA explicados cuestionario

que paso

Los investigadores presentaron THPT-Ladder, un punto de referencia creado a partir de 632 elementos en 21 exámenes oficiales vietnamitas en 11 materias. Aplica la rúbrica de puntuación convexa del Examen Nacional de Graduación de Escuela Secundaria de 2025, según la cual cuatro afirmaciones de verdadero/falso obtienen 0, 0,10, 0,25, 0,50 o 1,00 puntos en lugar de crédito proporcional. En ocho modelos, el artículo reporta puntuaciones de rúbrica oficial más bajas que la puntuación proporcional y muestra que las clasificaciones frente a candidatos humanos pueden cambiar sustancialmente.

El registro arXiv describe un problema al traducir el rendimiento del examen en un único número de precisión. En la Parte II del Examen Nacional de Graduación de Escuela Secundaria de Vietnam de 2025, cada pregunta contiene cuatro afirmaciones de verdadero o falso. La rúbrica oficial asigna 0 puntos cuando ninguna es correcta, luego 0,10, 0,25, 0,50 o 1,00 puntos a medida que el número de afirmaciones correctas aumenta de uno a cuatro. Esa tabla es más convexa que aditiva: tres afirmaciones correctas reciben 0,50 puntos, aunque tres de cuatro afirmaciones corresponderían a 0,75 según el crédito proporcional. El artículo trata esta diferencia como una cuestión de evaluación, no simplemente como un detalle de calificación, porque la Parte II representa 4,00 de los 10,00 puntos del examen. La fuente establece estas reglas como la descripción que hace el periódico de la reforma de 2025; no verifica de forma independiente la política de examen fuera del registro en papel citado.

Los autores dicen que crearon THPT-Ladder con 632 elementos extraídos de 21 exámenes oficiales que cubren 11 materias. Se informa que el punto de referencia califica las respuestas exactamente como el ministerio califica a sus estudiantes. El documento también dice que el ministerio publica calificaciones para más de un millón de candidatos, lo que permite a los investigadores colocar los resultados del modelo dentro de una cohorte de candidatos humanos. En ocho modelos, la rúbrica oficial supuestamente produce puntuaciones entre 0,020 y 0,159 puntos más bajas por pregunta de la Parte II que el crédito proporcional. El resumen no enumera los ocho modelos, no explica cómo se solicitó cada modelo, no identifica el número de ejecuciones ni describe si las respuestas se generaron en configuraciones idénticas. Esos detalles son importantes para interpretar las comparaciones numéricas y no los proporciona el texto autorizado que se proporciona aquí.

El resumen ofrece dos ejemplos del efecto de clasificación informado. Para Qwen3.5-27B en el examen de Historia de 2025, se dice que un déficit de 0,042 puntos mueve el modelo del percentil 90 al 77 entre 481.293 candidatos. El artículo también informa que un modelo con el nivel de precisión de Claude Sonnet 5 podría recibir entre 0,869 y 0,932 puntos por pregunta, dependiendo de cómo se distribuyan sus errores. En el relato de los autores, la precisión por sí sola no predice la penalización porque la puntuación oficial depende de qué afirmaciones se responden correctamente juntas dentro de cada pregunta. La fuente no proporciona los archivos de respuestas subyacentes, los intervalos de confianza, los desgloses a nivel de ítem ni una auditoría independiente de esos cálculos, por lo que estos hallazgos deben tratarse como resultados previos a la impresión informados en lugar de mediciones establecidas.

Detalles de la fuente: arxiv.org ↗

Por qué es importante

El artículo sostiene que las métricas de precisión ordinarias pueden describir un modelo como más capaz de lo que certificarían las reglas de calificación reales de una institución. Esto es importante para las evaluaciones de IA creadas a partir de exámenes humanos, especialmente cuando los resultados de referencia se utilizan para comparar modelos o hacer afirmaciones sobre la competencia educativa. Los hallazgos se limitan a los modelos y puntos de referencia informados; la fuente proporcionada no establece en qué medida se generaliza el resultado más allá del formato de examen de Vietnam.

La implicación central es metodológica. Un punto de referencia puede preservar la apariencia de rigor al mismo tiempo que mide un constructo diferente al utilizado por la institución cuyo examen toma prestado. Según la puntuación proporcional, cada declaración correcta adicional se considera una aportación de la misma cantidad. Según el esquema vietnamita descrito en el artículo, el conocimiento parcial se recompensa de manera desigual y algunas combinaciones de afirmaciones correctas e incorrectas reciben menos crédito de lo que sugeriría su pura precisión. Por lo tanto, la puntuación final de un modelo depende no sólo de cuántas afirmaciones acierta, sino también del patrón en el que ocurren esas afirmaciones. Para los lectores que comparan modelos, eso significa que una tabla de clasificación basada únicamente en la precisión agregada puede no responder a la pregunta práctica de cómo se comportaría un modelo según la norma de certificación oficial.

La comparación entre cohortes humanas informada hace que la cuestión sea más concreta. El documento dice que la diferencia de 0,042 puntos de Qwen3.5-27B en el examen de Historia de 2025 cambia su posición del percentil 90 al 77 entre 481.293 candidatos. Si se reproduce, no se trata de un cambio cosmético en la presentación: altera la comparación poblacional que un lector haría a partir de las mismas respuestas del modelo. El resultado no muestra que el modelo se haya vuelto menos capaz, ni establece que la ubicación del percentil prediga los resultados en el aula o en los exámenes. Muestra que la elección de la regla de puntuación cambia la medición.

La distinción es especialmente relevante cuando los puntos de referencia de los exámenes se utilizan para comunicar afirmaciones sobre el razonamiento, el conocimiento o la preparación para tareas educativas. El impacto público práctico reside principalmente en cómo se informa e interpreta el rendimiento de la IA. Los investigadores, educadores, formuladores de políticas y periodistas pueden confiar en puntajes de referencia sin ver cómo una fórmula de calificación maneja respuestas parciales. El argumento del artículo respalda la presentación de la puntuación oficial junto con la precisión cuando se pretende que el punto de referencia represente un examen real. También sugiere que los diseñadores de evaluaciones deberían revelar si la regla de puntuación de un punto de referencia es aditiva, proporcional, con umbrales o de otro modo no lineal. Al mismo tiempo, la fuente proporcionada no muestra que THPT-Ladder sea representativo de todas las pruebas de modelos lingüísticos, que el esquema de Vietnam sea común a nivel internacional o que una rúbrica convexa sea inherentemente superior. La contribución es una advertencia sobre la validez de constructo y la comparabilidad, no una evidencia de que un método de puntuación universal deba reemplazar a otro.

Interactive Mechanism

Mecanismo interactivo: cómo funciona realmente

Explore la tecnología subyacente detrás de este desarrollo de forma interactiva.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificación interactiva del concepto+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Qué ver a continuación

El seguimiento clave es si el estudio completo documenta sus indicaciones, versiones del modelo, condiciones de muestreo, implementación de puntuación, incertidumbre estadística y disponibilidad de datos. Los investigadores deberían probar si aparece la misma brecha en otros sistemas de clasificación no aditivos y en ejecuciones reproducidas de forma independiente. El artículo es una preimpresión de arXiv, por lo que la fuente proporcionada no establece un estado de revisión por pares ni una replicación independiente.

La primera cuestión de verificación es la reproducibilidad. El documento completo debe aclarar la composición exacta de 632 ítems, los 21 exámenes y 11 materias incluidas, la normalización de respuestas, el manejo de abstenciones o resultados ambiguos y la implementación de la rúbrica del ministerio. También debe identificar los ocho modelos y sus versiones precisas, porque los nombres de los modelos por sí solos pueden no determinar el comportamiento. La redacción de los mensajes, las instrucciones del sistema, la configuración de decodificación, la fecha de acceso y el número de generaciones independientes podrían afectar las puntuaciones. Ninguno de esos detalles aparece en el resumen de arXiv proporcionado, por lo que siguen siendo incógnitas significativas.

La segunda cuestión es la solidez estadística. Los ejemplos de los titulares implican un déficit de 0,042 puntos, un cambio de percentil del 90 al 77 y un rango de puntuación informado de 0,869 a 0,932 en un nivel de precisión establecido. Para evaluar su estabilidad, los lectores necesitarían resultados a nivel de ítem, estimaciones de incertidumbre, análisis de sensibilidad e información sobre la cohorte de comparación humana. También sería útil saber si los cambios en la clasificación persisten entre materias y años de exámenes, o si se concentran en tipos de preguntas particulares. El resumen informa los resultados de ocho modelos y un punto de referencia amplio, pero no establece la variación de esos resultados ni el grado en que los exámenes individuales generan la brecha agregada.

La prueba más amplia es si la brecha crediticia parcial se generaliza. Otros sistemas educativos pueden utilizar sanciones, umbrales, preguntas de varias partes o rúbricas que premian diferentes formas de conocimiento parcial. La aplicación del mismo análisis a esos entornos podría revelar si se trata de una característica específica de Vietnam o de una debilidad más amplia en la evaluación del modelo lingüístico basado en exámenes. Los equipos independientes también deberían comparar los puntajes de las rúbricas oficiales con otras medidas de desempeño educativo en lugar de asumir que la precisión o el puntaje convexo son una medida completa de competencia. Finalmente, el registro arXiv identifica el trabajo presentado el 18 de agosto de 2026 y lo presenta como una preimpresión. La fuente proporcionada no proporciona resultados de revisión por pares, replicación externa, implementación ni evidencia de que las autoridades examinadoras hayan adoptado el punto de referencia.

Guías y cuestionarios relacionados

Modelos de IA explicadosÉtica de la IAEntrenamiento de IAPon a prueba lo que sabes: prueba un cuestionario gratuito sobre IABusque un término de IA en nuestro glosarioSiga el rastreador de lanzamientos de modelos de IA
¿Encontró esto útil?