Voltar às notícias
InovaçãoInstruções AI Understanding

Novo benchmark mostra que a rubrica do exame do Vietnã pode mudar a classificação dos modelos de linguagem

Um artigo apresenta o THPT-Ladder, um benchmark de 632 itens que aplica o esquema de classificação do exame nacional do Vietnã de 2025 a modelos linguísticos e relata pontuações materialmente diferentes das medidas padrão de precisão proporcional.

6 min readRead the primary source
Source-page capture accompanying New benchmark shows Vietnam’s exam rubric can change how language models rank
Documento de origem primáriaFonte registrada
Editora
arxiv.org
Link da fonte
arxiv.orghttps://arxiv.org/abs/2608.18336
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Referência
Um teste padronizado ou conjunto de dados usado para medir e comparar o desempenho do modelo.
Normalização
Transformando valores em uma escala consistente para melhorar a estabilidade da otimização.
Robustez
A capacidade de um modelo de manter o desempenho sob ruído, mudanças ou entradas adversárias.
Teste você mesmoQuestionário explicado sobre modelos de IA

O que aconteceu

Os pesquisadores introduziram o THPT-Ladder, um construído a partir de 632 itens em 21 exames oficiais vietnamitas em 11 disciplinas. Aplica a rubrica de pontuação convexa do Exame Nacional de Graduação do Ensino Médio de 2025, sob a qual quatro afirmações verdadeiras/falsas ganham 0, 0,10, 0,25, 0,50 ou 1,00 pontos em vez de crédito proporcional. Em oito modelos, o artigo relata pontuações nas rubricas oficiais mais baixas do que a pontuação proporcional e mostra que as classificações em relação aos candidatos humanos podem mudar substancialmente.

O registro arXiv descreve um problema ao traduzir o desempenho do exame em um único número de precisão. Na Parte II do Exame Nacional de Graduação do Ensino Médio do Vietnã de 2025, cada pergunta contém quatro afirmações verdadeiras/falsas. A rubrica oficial atribui 0 pontos quando nenhuma está correta, depois 0,10, 0,25, 0,50 ou 1,00 pontos à medida que o número de afirmações corretas aumenta de um para quatro. Esse esquema é convexo e não aditivo: três afirmações corretas recebem 0,50 pontos, embora três em cada quatro afirmações correspondessem a 0,75 sob crédito proporcional. O artigo trata essa diferença como uma questão de avaliação e não apenas um detalhe de classificação, porque a Parte II representa 4,00 dos 10,00 pontos do exame. A fonte estabelece estas regras como a descrição do artigo da reforma de 2025; não verifica de forma independente a política de exame fora do registro em papel citado.

Os autores afirmam ter criado o THPT-Ladder com 632 itens extraídos de 21 exames oficiais abrangendo 11 disciplinas. O é relatado para avaliar as respostas exatamente como o ministério avalia seus alunos. O artigo também afirma que o ministério publica notas para mais de um milhão de candidatos, permitindo aos pesquisadores colocar os resultados do modelo dentro de uma coorte de candidatos humanos. Em oito modelos, a rubrica oficial produz pontuações entre 0,020 e 0,159 pontos mais baixas por questão da Parte II do que o crédito proporcional. O resumo não lista todos os oito modelos, explica como cada modelo foi solicitado, identifica o número de execuções ou descreve se as respostas foram geradas sob configurações idênticas. Esses detalhes são importantes para a interpretação das comparações numéricas e não são fornecidos pelo texto oficial fornecido aqui.

O resumo fornece dois exemplos do efeito de classificação relatado. Para Qwen3.5-27B no exame de História de 2025, diz-se que um déficit de 0,042 pontos move o modelo do 90º para o 77º percentil entre 481.293 candidatos. O artigo também informa que um modelo com nível de precisão do Claude Sonnet 5 poderia receber entre 0,869 e 0,932 pontos por questão, dependendo de como seus erros são distribuídos. No relato dos autores, a precisão por si só não prevê a penalidade porque a pontuação oficial depende de quais afirmações são respondidas corretamente em conjunto em cada questão. A fonte não fornece os arquivos de resposta subjacentes, intervalos de confiança, detalhamentos em nível de item ou uma auditoria independente desses cálculos, portanto, essas descobertas devem ser tratadas como resultados de pré-impressão relatados, em vez de medições estabelecidas.

Detalhes da fonte: arxiv.org ↗

Por que isso importa

The paper argues that ordinary accuracy metrics can describe a model as more capable than an institution’s actual grading rules would certify. That matters for AI evaluations built from human exams, especially when results are used to compare models or make claims about educational competence. The findings are limited to the reported benchmark and models; the supplied source does not establish how broadly the result generalizes beyond Vietnam’s exam format.

A implicação central é metodológica. Um pode preservar a aparência de rigor ao medir um construto diferente daquele utilizado pela instituição cujo exame ele empresta. Na pontuação proporcional, cada afirmação correta adicional é tratada como se contribuísse com o mesmo valor. No âmbito do esquema vietnamita descrito no artigo, o conhecimento parcial é recompensado de forma desigual e algumas combinações de declarações corretas e incorretas recebem menos crédito do que a sua precisão bruta poderia sugerir. A pontuação final de um modelo depende, portanto, não apenas de quantas afirmações ele acerta, mas também do padrão em que essas afirmações ocorrem. Para os leitores que comparam modelos, isso significa que uma tabela de classificação baseada apenas na precisão agregada pode não responder à questão prática de como seria o desempenho de um modelo sob a regra de certificação oficial.

A comparação relatada entre humanos e coortes torna a questão mais concreta. O artigo diz que a diferença de 0,042 pontos do Qwen3.5-27B no exame de História de 2025 muda sua posição do 90º para o 77º percentil entre 481.293 candidatos. Se reproduzido, isso não é uma mudança cosmética na apresentação: altera a comparação populacional que um leitor extrairia das mesmas respostas do modelo. O resultado não mostra que o modelo se tornou menos capaz, nem estabelece que a colocação percentual preveja os resultados da sala de aula ou dos exames. Mostra que a escolha da regra de pontuação altera a medição.

A distinção é especialmente relevante quando os benchmarks dos exames são usados ​​para comunicar afirmações sobre raciocínio, conhecimento ou prontidão para tarefas educacionais. O impacto público prático reside principalmente na forma como o desempenho da IA ​​é relatado e interpretado. Investigadores, educadores, decisores políticos e jornalistas podem confiar em pontuações de referência sem ver como uma fórmula de classificação lida com respostas parciais. O argumento do artigo apoia a divulgação da pontuação oficial juntamente com a precisão quando o se destina a representar um exame real. Sugere também que os criadores da avaliação devem divulgar se a regra de pontuação de um índice de referência é aditiva, proporcional, limitada ou de outra forma não linear. Ao mesmo tempo, a fonte fornecida não mostra que o THPT-Ladder seja representativo de todos os testes de modelos linguísticos, que o esquema do Vietname seja comum a nível internacional ou que uma rubrica convexa seja inerentemente superior. A contribuição é um alerta sobre a validade e comparabilidade do construto, e não uma evidência de que um método de pontuação universal deva substituir outro.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

O que assistir a seguir

O principal acompanhamento é se o estudo completo documenta suas solicitações, versões do modelo, condições de amostragem, implementação de pontuação, incerteza estatística e disponibilidade de dados. Os pesquisadores devem testar se a mesma lacuna aparece em outros sistemas de classificação não aditivos e em execuções reproduzidas independentemente. O artigo é uma pré-impressão do arXiv, portanto a fonte fornecida não estabelece status de revisão por pares ou replicação independente.

A primeira questão de verificação é a reprodutibilidade. O artigo completo deverá esclarecer a composição exata de 632 itens, os 21 exames e 11 disciplinas incluídas, a normalização das respostas, o tratamento de abstenções ou resultados ambíguos e a implementação da rubrica do ministério. Deve também identificar todos os oito modelos e suas versões precisas, porque os nomes dos modelos por si só podem não determinar o comportamento. O texto imediato, as instruções do sistema, as configurações de decodificação, a data de acesso e o número de gerações independentes podem afetar as pontuações. Nenhum desses detalhes aparece no resumo do arXiv fornecido, portanto, eles permanecem incógnitas significativas.

A segunda questão é a robustez estatística. Os exemplos principais envolvem um déficit de 0,042 pontos, uma mudança percentual do 90º para o 77º e uma faixa de pontuação relatada de 0,869 a 0,932 em um nível de precisão declarado. Para avaliar a sua estabilidade, os leitores precisariam de resultados ao nível dos itens, estimativas de incerteza, análises de sensibilidade e informações sobre a coorte de comparação humana. Também seria útil saber se as mudanças na classificação persistem entre disciplinas e anos de exames, ou se estão concentradas em determinados tipos de questões. O resumo relata resultados de oito modelos e um amplo, mas não estabelece a variação desses resultados ou até que ponto os exames individuais impulsionam a lacuna agregada.

O teste mais amplo é se a lacuna de crédito parcial se generaliza. Outros sistemas educacionais podem utilizar penalidades, limites, questões com várias partes ou rubricas que recompensam diferentes formas de conhecimento parcial. A aplicação da mesma análise a esses ambientes poderia revelar se esta é uma característica específica do Vietname ou uma fraqueza mais ampla na avaliação do modelo linguístico baseado em exames. As equipes independentes também devem comparar as pontuações das rubricas oficiais com outras medidas de desempenho educacional, em vez de presumir que a precisão ou a pontuação convexa são uma medida completa de competência. Por fim, o registro arXiv identifica o trabalho enviado em 18 de agosto de 2026 e o ​​apresenta como pré-impressão. A fonte fornecida não fornece resultados de revisão por pares, replicação externa, implantação ou evidência de que as autoridades examinadoras adotaram o .

Guias e questionários relacionados

Modelos de IA explicadosÉtica da IATreinamento de IATeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?